开启 3 天免费试用
注册即可免费体验全部高级功能。
*仅限新用户;每位用户只能获得一次试用。


用 AI 追问 AI 时,要更好地向 AI 追问或要求修改,先诊断当前回答中的一个缺陷,提出一项具体的修正要求,再把修订版与原版对照。重要事实要始终与原始来源绑定,因为更自信、更润色的第二个回答,并不自动更准确。
本流程从第一次回答之后开始。如果最初的请求本身还没定义清楚,请先看写好首轮 Prompt;需要规划整个任务时,使用更全面的有边界的 AI 工作流。
关键要点
- 要求新版本之前,先给问题分类。
- 每次只改变一个变量,这样才知道是什么改进了回答。
- 要求模型标出假设、未知项、证据和反例。
- 保留各个版本,而不是悄悄替换第一个回答。
- 剩下的决定需要来源、测量或负责任的人时,就停止。
对话提供了一个低成本的反馈循环。OpenAI 建议迭代改进:先审阅初始回答,再根据缺少的内容调整措辞、上下文或范围。[1] 当模型误解了任务、选错了详略程度,或用了不方便的格式时,这很有帮助。
迭代本身不会产生证据。如果第一个回答缺少可靠来源,问一句“你确定吗?”可能只会换来一个听起来更有底气的复述。有用的追问会指出缺失的证据,并要求一个可以核查的交付物,例如一份把每条主张与原始来源 URL 配对、并列出未解决事项的清单。
把对话当作一系列可检验的草稿。目标不是一直追问到模型同意你为止,而是在保留变化记录的同时,减少某个已点明的不确定性。
先读一遍看是否有用,再读一遍看属于哪种失败。把每个问题归入四类之一:
| 缺陷 | 表现 | 更好的追问 |
|---|---|---|
| 缺事实 | 缺少关键日期、定义、约束或来源 | “列出回答所需但缺失的事实,不要自行补上。” |
| 范围错 | 回答过宽、过窄、过于技术化或太泛 | “只修改设置决策部分,排除部署。” |
| 格式错 | 内容可用,但难以比较或执行 | “改成包含证据和未知项的三列决策表。” |
| 推理跳步 | 结论出现却没有可见的前提 | “列出这个结论的前提,并标出哪些是假设。” |
在能说出缺陷之前,不要要求“更好的回答”。否则下一个回答可能同时改变语气、长度、例子和结论,让你无法判断是哪项改变起了作用。
如果存在多个缺陷,就排出先后。先纠正错误的前提,再润色格式;先修正范围,再要求更多细节。建立在错误任务上的回答,格式再好也仍然是错的。
受控的追问只改变一个维度:范围、受众、证据标准、长度、结构或决策标准。OpenAI 的提示词指南强调清晰的上下文和明确的输出要求,包括长度和格式。[2] 同样的控制在后续轮次中也适用。
例如,假设第一个回答推荐了三个方案,却没有解释取舍。可以这样问:
保留同样的三个方案。只补充选择所需的假设、最大优势、主要缺点和证据。暂时不要增加新方案。
这条指令保留了基线。如果修订版更有用,你就知道缺失的维度是比较。如果你同时要求新方案、更短的回答、不同的受众、引用和推荐,就无法分离出是什么带来了改进。
对重要工作,保留一份简短的变更记录:
| 版本 | 改变的变量 | 预期效果 | 实际结果 |
|---|---|---|---|
| V1 | 初始请求 | 建立基线 | 范围宽泛,没有决策标准 |
| V2 | 增加标准 | 让方案可比较 | 取舍已显示,证据仍缺失 |
| V3 | 增加证据规则 | 区分主张与猜测 | 仍有两项主张未解决 |
上下文并非越多越好。只补充能解决已诊断缺口的最小事实包:受众、目标、约束、定义、已知证据和禁止的假设。一段政策或一张数据表就够时,不要粘贴整个项目历史。
用标题或分隔符把上下文与指令分开,再说明模型可以怎样使用它。例如:
已知事实: 已批准的预算范围、交付日期和支持的平台。 未知: 供应商是否支持数据导出。 任务: 只修改实施顺序。不要推断未知项;把它列为阻碍因素。
这种结构能防止未知项被吸收进流畅的文字里,也让之后删除过时的上下文更容易。
绝不要粘贴凭证、私人个人记录、客户数据、机密申请材料,或你无权分享的材料。如果答案依赖敏感事实,就用合成的标签代替,或使用获批准的环境。
许多薄弱的回答会把不确定性藏在顺滑的过渡语后面。用一条追问强制它分成四部分输出:
NIST 的生成式 AI 风险概况把风险管理围绕在整个使用过程中识别、衡量、管理和治理风险来组织。[3] 对用户而言,实际做法就是在依据回答行动之前,先让不确定性变得可见。
试试这条简洁的提示词:
审查你之前的回答。分成四部分:有依据的事实、假设、未知项和反例。对每条有依据的事实,写出核实它所需的来源。不要编造引用,也不要靠推断解决未知项。
如果模型提供了来源,就遵循 AI 引用核验流程。URL、标题或引文仍可能是错的、无关的、过时的或编造的。
不要用 V2 覆盖 V1,再靠记忆比较。两者都保留,然后要求按主张而非措辞整理差异:
要求模型只引用其先前草稿中的简短标识,而不是大段的来源段落。然后你就可以直接检查变化了的主张。
两个回答相互矛盾时,不要让模型投票。建一张小小的裁决表,列出矛盾的主张、各版本的依据、能够解决它的原始来源,以及当前状态。这样,分歧就变成了一张研究待办清单。
这个循环是一种审查方法,并不证明某个回答正确。每一轮都必须减少一个已点明的不确定性,否则就应停止。
当回答包含日期、法律规则、医疗或财务建议、统计数字、产品功能、引语,或关于某个具名个人或组织的主张时,使用单独的核验 AI 回答中的重要事实流程。从原始来源开始,而不是从搜索摘要或另一个 AI 总结开始。
研究任务请遵循安全使用 AI 做研究的流程:界定问题、收集来源、比较主张,并让未解决的冲突保持可见。NIST 的 AI RMF Playbook 同样为治理、映射、衡量和管理 AI 风险提供了建议行动;它是供人判断的菜单,而不是模型提供的保证。[4]
用底层数据集或计算核对数字。在来源段落及其上下文中核对引语。在当前的官方文档中核对当前的产品行为。对于后果重大的决定,即使所有引用看起来都有效,也要请负责的专业人士或负责人参与。
更多轮次可能增加噪音、让模型固守早先的错误,或耗费时间却得不到新证据。满足以下任一条件时就停止:
把结果记为接受、拒绝或未解决。证据缺失时,“未解决”是有用的结果,比再追问一轮去制造确定性更安全。
把以下七轮顺序当作菜单,而不是必须走完的剧本:
这个顺序之所以有效,是因为每一轮目的都很窄,并产出一份可审计的材料。跳过与实际缺陷无关的步骤。
现有上下文简短、相关且正确时,继续当前对话。指令相互冲突、任务改变、需要排除敏感上下文,或早先的错误不断影响后续回答时,新开对话,并只带入一份已核实的摘要。
单独使用通常没什么用。要问什么证据支持这个主张、哪些假设可能改变它,以及哪个原始来源能核实它。自信的语气不是可靠性的衡量标准。
只要能减少某个已点明的不确定性就可以继续,没有固定次数。满足验收标准,或剩余缺口需要外部证据或人的权限时,就停止。
可以,但要把批评当作又一份草稿。给它评分标准,要求主张层面的证据,然后独立核实重要的发现。
重新写明少数几条有约束力的条件,并要求它在修订前先列出这些条件。如果冲突仍然存在,就带着一份已核实的上下文包新开对话。
不需要。决策空间不确定时,备选方案有帮助,但它们可能分散对事实或范围缺陷的注意。先修正已诊断的问题,再在相同标准下要求备选方案。
要求它说明该来源支持的确切主张,以及文档标题、发布者、日期和直接 URL。亲自打开来源,核实段落、上下文和时效。
把完成的报告当作 V1,而不是结论。要求它列出主要主张及各自依据的来源、它没能回答的问题,以及它缩小或放弃的范围。然后每次只要求一项修改,并亲自核验关键引用。也可以让第二个模型审阅这份报告,但它的批评只是又一份草稿,不等于核验。
涉及法律、医疗、财务、雇佣、安全、隐私或其他后果重大的决定,缺少权限或涉及机密数据,以及证据仍有争议时,都需要有人负责作判断。
延伸阅读:
免责声明:本文提供一般信息。高后果结论应回到原始来源并由合格专业人士确认,同时遵守组织的隐私和决策控制规则。
来源:
Sources checked 2026 年 10 月 4 日。
注册即可免费体验全部高级功能。
*仅限新用户;每位用户只能获得一次试用。