开启 3 天免费试用
注册即可免费体验全部高级功能。
*仅限新用户;每位用户只能获得一次试用。


想让 AI 引用来源,应该先限定问题,要求每个重要主张都有可追溯来源,再亲自检查引用。链接或脚注只是线索,不是保证:OpenAI 提醒 ChatGPT 可能生成不存在的引用,或错误描述真实来源的内容。[1]
更完整的证据意识可以参考如何核查 AI 回答。本文聚焦一个更窄的任务:把 AI 回答拆成“主张/证据”工作表,让别人也能复核。
关键要点
- 先把回答拆成主张,再查看其中的引用。
- 要求提供稳定的来源信息,而不只是一串链接。
- 检查来源是否存在、是否有资格支持该主张,以及是否真的支持它。
- 改写时保留日期、限定语、人群和定义。
- 把主张标为无依据或不确定,而不是把一句看似合理的话升级为事实。
AI 系统是在预测文本。即使某个条目并不存在,它也能生成看起来很真实的标题、URL、作者、引语或页码。它还可能把一个真实来源挂到该来源从未说过的句子上。OpenAI 的指引把这类“虚假引用”描述为已知的失效模式,并建议在原始来源中核实重要信息。[1]
区别很简单:
| 项目 | 它能说明什么 | 它不能说明什么 |
|---|---|---|
| 出现引用 | 回答中有一个引用样式的对象 | 页面真实存在或与主题相关 |
| 来源真实 | 你能打开该页面或文档 | 来源支持这句确切的主张 |
| 段落相关 | 文字涉及该主题 | 段落能证明因果、时效或普遍性 |
| 证据充分 | 主张通过了你定义的检验 | 主张对每一项决策都安全 |
把每一行都当作一项单独的检验。如果一项高风险主张没有通过其中一项检验,不要用更好的文字去挽救它。
把草稿复制到工作表中,并拆分复合句。“该政策使欺诈减少了 20%,并且适用于所有客户”至少包含两项主张:一项测得的变化和一项泛化。它们可能需要不同的来源和不同的检查。
每项主张占一行:
| 主张 ID | 原文中的主张 | 所需证据 | 出错的风险 |
|---|---|---|---|
| C1 | 该政策减少了报告的欺诈 | 带日期、有明确比较对象的测量 | 决策可能高估影响 |
| C2 | 结果适用于所有客户 | 人群和抽样证据 | 某个群体可能被排除 |
| C3 | 该政策目前仍然有效 | 当前的官方政策页面 | 读者可能遵循旧规则 |
把原始措辞放在一列,把你谨慎改写后的版本放在另一列。这样在为了流畅而编辑时,更不容易忘记某个限定语。
不要只说“加上来源”。告诉模型一条可用的来源记录包含什么,以及找不到来源时该怎么做。例如:
为下面每项主张提供一到两个公开来源。返回一张表,包含主张 ID、来源标题、发布者、发布日期、URL、支持的段落或章节,以及一句话的局限说明。只使用你能确认的来源。如果某个来源无法核实,写“未核实”,不要编造 URL 或引语。把事实与你的解读分开。
把主张和允许使用的来源范围交给模型。如果你已有一组来源,就写明这些文档或页面。如果主题有时效性,就加上日期要求,并让它标出较旧的材料。
截图展示公开 Gemini 零状态界面中的合成提示词,未提交回答,不含账号或客户资料。
这份约定就是一项验收测试。即使链接看起来很可信,缺少发布者、日期、局限或核实状态的回答也是不完整的。
亲自打开每个 URL。对于文档,使用官方发布者、资料库、DOI 记录或原始数据集,而不是转载的摘要。检查:
如果 URL 返回登录墙、重定向或无关页面,就把该来源标为未核实。不要因为模型很自信就推断它存在。
对于法律或政策,从发布机构开始。对于测量数据,从数据集或方法部分开始。对于产品功能,从供应商当前的文档开始,并说明可用性可能取决于账户、地区或方案。二手文章可以帮你找到一手来源,但不应悄悄取代它。
阅读段落周围足够的上下文,以理解其对象、条件和例外。然后对二者的关系进行分类:
| 结果 | 含义 | 较安全的说法 |
|---|---|---|
| 支持 | 段落在相同条件下陈述了该主张 | “报告指出……” |
| 部分支持 | 段落只支持一个更窄的版本 | “在受研究的群体中……” |
| 矛盾 | 段落说的是不同的内容 | “来源不支持这一说法” |
| 未找到 | 你找不到所声称的证据 | “未找到支持段落” |
| 不清楚 | 来源或上下文无法访问 | “有待核实” |
留意常见的“升级”:
在改写中保留来源的局限。如果原文说的是“某一个城市的受访者”,就在句子和工作表中都保留这个边界。
如果模型提供了引语,就在来源中搜索确切的措辞,并确认附近的句子没有反转其含义。简短的摘录更容易审核,也更不容易超出发布者的转载政策。如果找不到这段引语,就改为明确标注的转述,或把该主张标为无依据。
对于转述,比较主语、动词、数字、日期、条件和结论。把“可能”改成“确实”这样的小变化,就可能改变一条操作指令的风险。可以要求模型列出差异或被改动的限定语,但最终的比较要由你自己完成。
在工作文档中使用一张精简的主张/证据表:
| ID | 主张 | 来源 | 已检查的段落 | 结果 | 局限 | 负责人 |
|---|---|---|---|---|---|---|
| C1 | 该政策减少了报告的欺诈 | 官方评估,第 8 页 | “……” | 部分支持 | 一个地区,六个月 | 分析员 |
| C2 | 结果适用于所有客户 | 同一评估 | 没有全体范围的测试 | 未找到 | 样本不含新账户 | 审核人 |
负责人一栏能防止工作表变成装饰性的附录。把未解决的行交给一位具名的审核人,在审核人结案之前,不要把它们写进摘要。
对于健康、法律、金融、雇佣、安全、身份或生产环境变更,要求一手来源和一位负责的人工审核者。如果来源无法访问、已经过时,或只是间接相关,就停下来,要求更好的证据。NIST 的生成式 AI 风险概况强调记录风险、局限和人工监督,而不是把生成的文本当作不容置疑的权威。[2]
使用发布者的搜索或站内导航找到当前的来源。记录这一不符之处,并从草稿中删除模型生成的 URL。绝不要靠猜测一个相近的路径来修复失效的引用。
拆分主张,并询问该来源支持的是哪一句。只有当第二个来源涵盖一个不同的命题时,才添加它;不要在没有提高覆盖面的情况下堆砌参考文献。
从周围的段落中补上人群、日期、方法或置信区间。如果这个局限改变了结论,就改写主张,而不是把细节藏在脚注里。
把搜索摘要当作发现线索。打开页面,确认发布者和日期,并引用页面本身。搜索排名不能证明权威性。
重申输出约定,并要求增加一个核实状态栏。如果它仍然填补空白,就把回答移入“未核实”队列,并在模型之外核实这些主张。
在发布或依据 AI 辅助的回答采取行动之前:
对于团队,把工作表与草稿一起保存,并请第二个人抽查风险最高的几行。目的不是让每一句话都听起来很谨慎,而是让推理过程可以追溯。
可靠的 AI 引用来自一套可重复的检查,而不是某个特殊的提示词。界定主张,索要完整的来源记录,打开原文,把段落与措辞对照,保留局限,并把未解决的行交给一位人工负责人。
要求提供来源标题、发布者、日期、稳定的 URL、支持的段落或章节,以及局限说明。再加上核实状态,让缺失的证据明确显示出来,而不是被悄悄省略。
阅读被引用的段落及其上下文。把对象、测量、日期、人群、定义和限定语,与你打算发布的句子逐一对照。
不一定。权威性让一个来源值得审视,但并不自动具有决定性。检查它的方法、范围、日期和局限;当决策很重要时,再与另一个一手来源比较。
通常应把它从结论中删除,或标为未经核实的线索。只有在指派了专人去寻找和评估缺失的证据时,才把它保留在研究队列中。
它可以帮忙发现不一致之处,但不能代替你打开来源。把另一个模型当作审核辅助工具,一手来源的核查仍在模型之外完成。
没有通用的数量。使用足够多的权威来源,覆盖各项主张及其重要局限。一个出色的一手来源,可能胜过五个不相关的链接。
记录引用和访问限制,然后寻找合法的公开摘要、资料库副本,或能查看全文的合格审核者。如果把摘要当作等同于全文,就必须说明。
来源:
Sources checked 2026 年 8 月 23 日。
延伸阅读:
注册即可免费体验全部高级功能。
*仅限新用户;每位用户只能获得一次试用。