用 AI 追问 AI:如何向 AI 追问、提出修改并核验回答

用 AI 追问 AI:如何向 AI 追问、提出修改并核验回答

Olivia Park
2026年8月24日· 更新于 2026年10月4日· 9 分钟阅读

用 AI 追问 AI 时,要更好地向 AI 追问或要求修改,先诊断当前回答中的一个缺陷,提出一项具体的修正要求,再把修订版与原版对照。重要事实要始终与原始来源绑定,因为更自信、更润色的第二个回答,并不自动更准确。

本流程从第一次回答之后开始。如果最初的请求本身还没定义清楚,请先看写好首轮 Prompt;需要规划整个任务时,使用更全面的有边界的 AI 工作流。

关键要点

  • 要求新版本之前,先给问题分类。
  • 每次只改变一个变量,这样才知道是什么改进了回答。
  • 要求模型标出假设、未知项、证据和反例。
  • 保留各个版本,而不是悄悄替换第一个回答。
  • 剩下的决定需要来源、测量或负责任的人时,就停止。

如何向 AI 追问并改进 AI 回答?

对话提供了一个低成本的反馈循环。OpenAI 建议迭代改进:先审阅初始回答,再根据缺少的内容调整措辞、上下文或范围。[1] 当模型误解了任务、选错了详略程度,或用了不方便的格式时,这很有帮助。

迭代本身不会产生证据。如果第一个回答缺少可靠来源,问一句“你确定吗?”可能只会换来一个听起来更有底气的复述。有用的追问会指出缺失的证据,并要求一个可以核查的交付物,例如一份把每条主张与原始来源 URL 配对、并列出未解决事项的清单。

把对话当作一系列可检验的草稿。目标不是一直追问到模型同意你为止,而是在保留变化记录的同时,减少某个已点明的不确定性。

第一步:诊断首轮回答

先读一遍看是否有用,再读一遍看属于哪种失败。把每个问题归入四类之一:

缺陷表现更好的追问
缺事实缺少关键日期、定义、约束或来源“列出回答所需但缺失的事实,不要自行补上。”
范围错回答过宽、过窄、过于技术化或太泛“只修改设置决策部分,排除部署。”
格式错内容可用,但难以比较或执行“改成包含证据和未知项的三列决策表。”
推理跳步结论出现却没有可见的前提“列出这个结论的前提,并标出哪些是假设。”

在能说出缺陷之前,不要要求“更好的回答”。否则下一个回答可能同时改变语气、长度、例子和结论,让你无法判断是哪项改变起了作用。

如果存在多个缺陷,就排出先后。先纠正错误的前提,再润色格式;先修正范围,再要求更多细节。建立在错误任务上的回答,格式再好也仍然是错的。

第二步:用更好的 AI 追问提示词一次只改变一个变量

受控的追问只改变一个维度:范围、受众、证据标准、长度、结构或决策标准。OpenAI 的提示词指南强调清晰的上下文和明确的输出要求,包括长度和格式。[2] 同样的控制在后续轮次中也适用。

例如,假设第一个回答推荐了三个方案,却没有解释取舍。可以这样问:

保留同样的三个方案。只补充选择所需的假设、最大优势、主要缺点和证据。暂时不要增加新方案。

这条指令保留了基线。如果修订版更有用,你就知道缺失的维度是比较。如果你同时要求新方案、更短的回答、不同的受众、引用和推荐,就无法分离出是什么带来了改进。

对重要工作,保留一份简短的变更记录:

版本改变的变量预期效果实际结果
V1初始请求建立基线范围宽泛,没有决策标准
V2增加标准让方案可比较取舍已显示,证据仍缺失
V3增加证据规则区分主张与猜测仍有两项主张未解决

第三步:只补必要上下文和输出约束

上下文并非越多越好。只补充能解决已诊断缺口的最小事实包:受众、目标、约束、定义、已知证据和禁止的假设。一段政策或一张数据表就够时,不要粘贴整个项目历史。

用标题或分隔符把上下文与指令分开,再说明模型可以怎样使用它。例如:

已知事实: 已批准的预算范围、交付日期和支持的平台。 未知: 供应商是否支持数据导出。 任务: 只修改实施顺序。不要推断未知项;把它列为阻碍因素。

这种结构能防止未知项被吸收进流畅的文字里,也让之后删除过时的上下文更容易。

绝不要粘贴凭证、私人个人记录、客户数据、机密申请材料,或你无权分享的材料。如果答案依赖敏感事实,就用合成的标签代替,或使用获批准的环境。

第四步:要求标出假设、未知项、反例和证据

许多薄弱的回答会把不确定性藏在顺滑的过渡语后面。用一条追问强制它分成四部分输出:

  1. 已观察或已提供的事实: 回答能直接支持的内容。
  2. 假设: 未经当前证明就被接受的前提。
  3. 未知项: 需要但无法获得的信息。
  4. 反例: 建议会失效的条件。

NIST 的生成式 AI 风险概况把风险管理围绕在整个使用过程中识别、衡量、管理和治理风险来组织。[3] 对用户而言,实际做法就是在依据回答行动之前,先让不确定性变得可见。

试试这条简洁的提示词:

审查你之前的回答。分成四部分:有依据的事实、假设、未知项和反例。对每条有依据的事实,写出核实它所需的来源。不要编造引用,也不要靠推断解决未知项。

如果模型提供了来源,就遵循 AI 引用核验流程。URL、标题或引文仍可能是错的、无关的、过时的或编造的。

第五步:比较版本并保留差异

不要用 V2 覆盖 V1,再靠记忆比较。两者都保留,然后要求按主张而非措辞整理差异:

  • 新增、删除或实质性改变的主张;
  • 新增或撤回的证据;
  • 被升格为事实的假设;
  • 范围或受众的变化;
  • 改变了的建议及原因。

要求模型只引用其先前草稿中的简短标识,而不是大段的来源段落。然后你就可以直接检查变化了的主张。

两个回答相互矛盾时,不要让模型投票。建一张小小的裁决表,列出矛盾的主张、各版本的依据、能够解决它的原始来源,以及当前状态。这样,分歧就变成了一张研究待办清单。

这个循环是一种审查方法,并不证明某个回答正确。每一轮都必须减少一个已点明的不确定性,否则就应停止。

第六步:核验事实、引用、数字和高风险建议

当回答包含日期、法律规则、医疗或财务建议、统计数字、产品功能、引语,或关于某个具名个人或组织的主张时,使用单独的核验 AI 回答中的重要事实流程。从原始来源开始,而不是从搜索摘要或另一个 AI 总结开始。

研究任务请遵循安全使用 AI 做研究的流程:界定问题、收集来源、比较主张,并让未解决的冲突保持可见。NIST 的 AI RMF Playbook 同样为治理、映射、衡量和管理 AI 风险提供了建议行动;它是供人判断的菜单,而不是模型提供的保证。[4]

用底层数据集或计算核对数字。在来源段落及其上下文中核对引语。在当前的官方文档中核对当前的产品行为。对于后果重大的决定,即使所有引用看起来都有效,也要请负责的专业人士或负责人参与。

第七步:定义停止条件

更多轮次可能增加噪音、让模型固守早先的错误,或耗费时间却得不到新证据。满足以下任一条件时就停止:

  • 交付物已满足明确的验收标准;
  • 剩下的未知项需要对话中没有的来源、测量、工具、权限或人;
  • 两次修订在没有新证据的情况下重复同一主张;
  • 模型改变结论,却没有说明新的前提;
  • 下一步行动后果重大,需要有人负责批准;
  • 任务已偏离最初的范围。

把结果记为接受、拒绝或未解决。证据缺失时,“未解决”是有用的结果,比再追问一轮去制造确定性更安全。

可复用的追问顺序

把以下七轮顺序当作菜单,而不是必须走完的剧本:

  1. “给你回答中的弱点分类;暂时不要修改。”
  2. “只修正范围问题,主张和结构保持不变。”
  3. “加入以下已核实的上下文,并标出冲突。”
  4. “分开写事实、假设、未知项和反例。”
  5. “在主张层面把这个版本与 V1 比较。”
  6. “列出未解决主张所需的原始来源或测量。”
  7. “说明是否满足验收标准,以及哪些需要人来判断。”

这个顺序之所以有效,是因为每一轮目的都很窄,并产出一份可审计的材料。跳过与实际缺陷无关的步骤。

总结

  • 先诊断是缺事实、范围错、格式错还是推理跳步。
  • 一次只改变一个变量,并保留之前的版本。
  • 只补充最少的上下文和明确的输出约束。
  • 强制把假设、未知项、反例和证据分开写。
  • 在原始来源中核实重要主张;对话无法解决剩余问题时就停止。

常见问题

应继续当前对话还是新开对话?

现有上下文简短、相关且正确时,继续当前对话。指令相互冲突、任务改变、需要排除敏感上下文,或早先的错误不断影响后续回答时,新开对话,并只带入一份已核实的摘要。

“你确定吗”是好的追问吗?

单独使用通常没什么用。要问什么证据支持这个主张、哪些假设可能改变它,以及哪个原始来源能核实它。自信的语气不是可靠性的衡量标准。

应该追问多少轮?

只要能减少某个已点明的不确定性就可以继续,没有固定次数。满足验收标准,或剩余缺口需要外部证据或人的权限时,就停止。

可以让 AI 自我批评吗?

可以,但要把批评当作又一份草稿。给它评分标准,要求主张层面的证据,然后独立核实重要的发现。

模型忘记早先约束怎么办?

重新写明少数几条有约束力的条件,并要求它在修订前先列出这些条件。如果冲突仍然存在,就带着一份已核实的上下文包新开对话。

每轮都要生成多个方案吗?

不需要。决策空间不确定时,备选方案有帮助,但它们可能分散对事实或范围缺陷的注意。先修正已诊断的问题,再在相同标准下要求备选方案。

如何追问一个引用?

要求它说明该来源支持的确切主张,以及文档标题、发布者、日期和直接 URL。亲自打开来源,核实段落、上下文和时效。

AI 工具完成研究报告后该追问什么?

把完成的报告当作 V1,而不是结论。要求它列出主要主张及各自依据的来源、它没能回答的问题,以及它缩小或放弃的范围。然后每次只要求一项修改,并亲自核验关键引用。也可以让第二个模型审阅这份报告,但它的批评只是又一份草稿,不等于核验。

什么时候必须转人工?

涉及法律、医疗、财务、雇佣、安全、隐私或其他后果重大的决定,缺少权限或涉及机密数据,以及证据仍有争议时,都需要有人负责作判断。


延伸阅读:

免责声明:本文提供一般信息。高后果结论应回到原始来源并由合格专业人士确认,同时遵守组织的隐私和决策控制规则。

来源:

  1. OpenAI — Prompt engineering best practices for ChatGPT — https://help.openai.com/en/articles/10032626-how-do-i-prompt-chatgpt-effectively
  2. OpenAI — Best practices for prompt engineering with the OpenAI API — https://help.openai.com/en/articles/6654000-best-practices-for-prompt-engineering-with-the-openai-api
  3. NIST — Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile — https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence
  4. NIST — AI Risk Management Framework Playbook — https://airc.nist.gov/AI_RMF_Knowledge_Base/Playbook

Sources checked 2026 年 10 月 4 日。

开启 3 天免费试用

注册即可免费体验全部高级功能。

*仅限新用户;每位用户只能获得一次试用。

用 AI 追问 AI:如何向 AI 追问、提出修改并核验回答 | AethoVPN