开启 3 天免费试用
注册即可免费体验全部高级功能。
*仅限新用户;每位用户只能获得一次试用。


如何核验 AI 答案?一次只查一条主张最容易。AI 的答案可能听上去很确定,实际却错误、不完整、已过时,或者所附引用并没有说出答案声称的内容。不要凭语气判断一段话。
关键要点
- 核验前先把回答拆成独立的主张。
- 为每条主张匹配权威且范围相符的来源。
- 亲自核对日期、数字、措辞和冲突。
- 标出没有依据的主张,而不是用流畅的文字填补空白。
**示例任务(截图中未显示):**查看供应商当前帮助页是否支持某项所述功能;如果来源没有提到,就把这条主张标记为
not verified。
**核心规则:**有引用,不等于引用支持这条主张。
把答案复制到表格里,把事实、日期、数字、建议和解读分开。一个含三个分句的句子,可能包含三条独立主张。在弄清结论依赖哪些证据之前,不要急着核验结论。
| 主张 | 风险 | 所需证据 | 结果 |
|---|---|---|---|
| 产品支持某项功能 | 当前产品事实 | 官方文档 | 已核验 / 未核验 |
| 某个数字发生变化 | 时效性事实 | 有日期的原始来源 | 日期确认 / 已过时 |
| 某项政策适用于某群体 | 范围敏感的事实 | 政策及其例外 | 适用 / 不适用 |
| 某项建议是安全的 | 有后果的判断 | 专业指导和具体情境 | 人工复核 |
先查高风险或变化快的主张:健康、法律、财务、安全、账户资格、价格、软件行为和地区可用性。一个有明确日期的历史事实,往往不如一项当前的支持政策那样急需复核。
可以让工具标出不确定之处,但不要把它的标签当作证据。如果答案里有当前日期、版本、配额、国家名单或法律要求,就亲自去找供应商、监管机构或原始研究者。
优先使用原始来源:官方帮助页、规范、政策、数据集、论文、备案文件或当事方的直接声明。搜索摘要和二手总结能帮你找到来源,但它们本身不是来源。
检查四条边界:
如果页面链接到另一项政策,就顺着链接打开。在笔记里记下 URL 和访问日期。
阅读来源中相关段落的前后文。留意以下常见错误:
来源含糊时,保留这种不确定,不要硬逼出“是 / 否”的答案。
用一份小型证据记录:
Claim:
Source URL:
Relevant passage:
Published or updated date:
Scope and exceptions:
Status: verified / partly supported / not verified
Next action:
不要仅仅为了问答案对不对,就把机密文件粘贴进 AI 工具。AI 工具隐私风险指南说明了分享证据前如何脱敏。
对每条主张,记下来源证明了什么、留下了什么空白,以及下一步做什么。一份紧凑的记录,能防止某个引用被挪用到它的日期、人群、产品版本或司法辖区之外。它也让之后的复核更快:别人可以重复这次检查,而无需信任原始答案或你对页面的记忆。
让 AI 返回确切的来源 URL,以及它认为该来源支持的主张。然后亲自打开这个 URL。编造的标题、失效的链接或看似可信的域名都属于失败,而不是小小的格式问题。
需要可重复的研究流程,可参考如何安全地使用 AI 做研究。想让答案一开始就暴露不确定性,可参考能让缺口显形的提示词写法。
如果答案得不到证据支持,就不要据此发布内容、运行代码、付款、修改账户,或作出健康、法律方面的决定。写上“未核验”,请教合资格的人,或回到原始来源。
不同的主张需要不同的证据。关于产品设置的句子,应指向该产品当前的帮助页;关于科学效应的句子,应写明研究、人群、方法和局限;关于法律的句子,应写明司法辖区和官方文本。不要因为某个通用来源含有相同的关键词就接受它。
数字需要额外核一遍。确认单位、分母、时间段、取整方式,以及这个值是平均值、估算、阈值还是保证。“最高可达”不等于“通常”,没有说明人群的百分比也可能误导。如果答案换算了某个数字,就用计算器或小脚本重算一次,并把原始值放在结果旁边。
操作说明除了核对真假,还需要安全检查。一条命令即使准确抄自文档,也可能不适合你的操作系统、权限、版本或数据。先在一次性环境中测试。如果操作会更改账户、删除数据、发送消息或影响生产环境,即使来源权威,也要设置人工批准步骤。
假设某个答案说:“该套餐向所有用户提供功能 X,提示词保存三十天,而且在所有地区可用。”这不是一条事实,而要拆成三行:
| 主张 | 最低核验 |
|---|---|
| 套餐包含功能 X | 当前套餐文档及其例外 |
| 提示词保存三十天 | 隐私或保留政策,以及账户和工作区范围 |
| 服务在所有地区可用 | 支持地区列表和账户资格规则 |
第一个来源也许支持该功能,却对保留期只字未提。隐私政策描述的可能只是默认设置,而企业工作区有不同的控制项。可用性页面也许列出了支持的国家,却不能证明每个账户都能注册。把每项结果分开记录:已核验、部分支持、未核验或不适用。
如果答案附了引用,就对比确切措辞。写着“部分客户可能可以使用”的页面,并不支持“所有用户都能使用”。描述某项设置的来源,也不能证明你的账户已经启用了它。把这些边界写进证据记录,而不是在最终文字里把它们抹平。
两个可信来源可能互相矛盾,因为它们描述的是不同的版本、日期、地区、人群或定义。先用中立的语言写下冲突。然后判断哪个来源对这个问题具有权威性,以及哪个更新或更具体。法律定义可能由监管机构决定;当前界面以产品帮助页为准;某项研究的测量结果以研究本身为准。
如果冲突仍未解决,就把两种说法连同各自的范围一起保留,并说明怎样才能解决。不要对法律要求取平均、推断出产品保证,或挑一个更方便的数字。遇到高影响的决定,请教负责的专家,并让批准决定的人看得到这个未解决点。
保留原始答案、拆出的主张、你打开的 URL、相关段落、发布或更新日期,以及最终状态。只保存必要的最少文字,并对个人或机密内容脱敏。截图可以显示你当时看到的内容,但 URL 加引用原文更便于审核推理过程;页面可能变化时,两者都保存。
来源无法访问时,要如实写明。不要让 AI 凭记忆重建付费墙后的文章、私人文件或已缺失的页面。把这条主张标为未解决,再去找可访问的原始来源或合资格的复核人。核验的目的不是做出一张看起来完整的表格,而是展示哪些主张有依据、哪些没有。
简短引语应与来源完全一致,包括说话人和上下文中的限定语。如果你翻译、缩写或合并了几段文字,就把结果标为转述。不要给来源从未说过的句子加上引号。对于代码、公式和结构化数据,对照原始字符并运行安全测试,而不是看着像就算数。
答案综合多个来源时,要求它为每个要点保留来源边界。一段混合了两项研究的话,可能让一项研究看起来支持了另一项研究的结论。把主张拆开,分别引用,并注明哪些证据是间接的。多做这点记录,比日后修补一个自信却无从追溯的结论要快。
把主张表和最终稿放在一起,让其他复核人不必依赖模型的措辞或自信,就能重现这个决定。
它应当一直作为证据链的一部分,供之后的更新和审计使用。
开始前先定好清晰的决策门槛。低风险的解释,一个当前的原始来源也许就够;健康、法律、财务、安全或账户方面的决定,则需要更强的证据和合资格的复核人。达不到门槛时,就让这条主张保持未解决,而不是用一个看似合理的答案填补空白。一条可见的停止规则,本身就是正确核验的一部分,而不是流程失败的标志。
核验是一套证据流程,而不是信心测试。把答案拆成主张,按风险排序,打开原始来源,对比确切措辞,记录日期和范围,缺少支持时就停下。
上述核验方法以所引用的 AI 风险与信息评估指南为依据。[1][2][3]
不能。引用必须真实存在、仍然有效、范围相符,并且强到足以支持这条确切的主张。
记录冲突,比较日期和范围,优先采用对该问题具有权威性的来源;决定后果重大时,请教专家。
可以把它当作第二轮检查,但这不能代替你亲自打开来源。
找到有日期的原始来源,确认单位和时间段,并检查这个数字是估算、平均值、上限还是保证。
删除它、标明未核验,或者围绕你能证实的主张重写。不要用自信的措辞掩盖不确定性。
免责声明:本文仅供一般信息参考,不构成法律、医疗、财务或专业建议。高风险决定必须由合资格人士复核。
来源:
Sources checked 2026 年 8 月 22 日。
延伸阅读:
注册即可免费体验全部高级功能。
*仅限新用户;每位用户只能获得一次试用。