開啟 3 天免費試用
註冊即可免費體驗全部高級功能。
*只限新用戶;每位用戶只可獲得一次試用。


想讓 AI 引用來源,應先限定問題,要求每個重要主張都有可追溯來源,再親自檢查引用。連結或腳註只是線索,不是保證:OpenAI 提醒 ChatGPT 可能產生不存在的引用,或錯誤描述真實來源的內容。[1]
更完整的證據習慣可參考如何核查 AI 回答。本文聚焦一個較窄的任務:把 AI 回答拆成「主張/證據」工作表,讓其他人也能覆核。
關鍵要點
- 先把回答拆成主張,再查看其中的引用。
- 要求提供穩定的來源資料,而不只是一串連結。
- 檢查來源是否存在、是否有資格支持該主張,以及是否真的支持它。
- 改寫時保留日期、限定語、群組和定義。
- 把主張標示為無依據或不確定,而不是把一句看似合理的話升格為事實。
AI 系統是在預測文字。即使某個項目並不存在,它也能產生看來很真實的標題、URL、作者、引述或頁碼。它亦可能把一個真實來源掛到該來源從未說過的句子上。OpenAI 的指引把這類「虛假引用」描述為已知的失效模式,並建議在原始來源核實重要資料。[1]
分別很簡單:
| 項目 | 它能說明甚麼 | 它不能說明甚麼 |
|---|---|---|
| 出現引用 | 回答中有一個引用樣式的項目 | 頁面真實存在或與主題相關 |
| 來源真實 | 你能開啟該頁面或文件 | 來源支持這句確實的主張 |
| 段落相關 | 文字涉及該主題 | 段落能證明因果、時效或普遍性 |
| 證據充分 | 主張通過你界定的檢驗 | 主張對每一項決策都安全 |
把每一列都當作一項獨立的檢驗。如一項高風險主張沒有通過其中一項檢驗,不要用更好的文字挽救它。
把草稿複製到工作表,並拆分複合句。「該政策令欺詐減少了 20%,而且適用於所有客戶」最少包含兩項主張:一項量度所得的變化和一項推而廣之的說法。它們可能需要不同的來源和不同的檢查。
每項主張佔一列:
| 主張 ID | 原文中的主張 | 所需證據 | 出錯的風險 |
|---|---|---|---|
| C1 | 該政策減少了通報的欺詐 | 附日期、有明確比較對象的量度 | 決策可能高估影響 |
| C2 | 結果適用於所有客戶 | 群組和抽樣證據 | 某個群組可能被排除 |
| C3 | 該政策目前仍然有效 | 現行的官方政策頁面 | 讀者可能遵從舊規則 |
把原始措辭放在一欄,把你審慎改寫的版本放在另一欄。這樣在為流暢而編輯時,較不容易遺忘某個限定語。
不要只說「加上來源」。告訴模型一項可用的來源紀錄包含甚麼,以及找不到來源時怎麼辦。例如:
為以下每項主張提供一至兩個公開來源。返回一張表,包含主張 ID、來源標題、發布者、發布日期、URL、支持的段落或章節,以及一句局限說明。只使用你能確認的來源。如某個來源無法核實,寫「未核實」,不要虛構 URL 或引述。把事實與你的詮釋分開。
把主張和容許使用的來源範圍交給模型。如你已有一組來源,便寫明這些文件或頁面。如主題有時效性,便加上日期要求,並要求它標示較舊的材料。
截圖展示公開 Gemini 零狀態介面中的合成提示詞,沒有提交回答,也不含帳戶或客戶資料。
這份約定就是一項驗收測試。即使連結看來很可信,欠缺發布者、日期、局限或核實狀態的回答也不完整。
親自開啟每個 URL。文件方面,使用官方發布者、資料庫、DOI 紀錄或原始數據集,而不是轉載的摘要。檢查:
如 URL 返回登入牆、重新導向或無關頁面,便把該來源標示為未核實。不要因為模型很有信心便推斷它存在。
法律或政策方面,由發出機構開始。量度數據方面,由數據集或方法部分開始。產品功能方面,由供應商現行的文件開始,並說明可用性可能取決於帳戶、地區或方案。第二手文章可以協助你找到第一手來源,但不應悄悄取代它。
細閱段落周圍足夠的上下文,以理解其對象、條件和例外。然後為兩者的關係分類:
| 結果 | 含義 | 較安全的說法 |
|---|---|---|
| 支持 | 段落在相同條件下陳述該主張 | 「報告指出……」 |
| 部分支持 | 段落只支持一個較窄的版本 | 「在受研究的群組中……」 |
| 矛盾 | 段落說的是不同的內容 | 「來源不支持這個說法」 |
| 找不到 | 你找不到所聲稱的證據 | 「找不到支持段落」 |
| 不清楚 | 來源或上下文無法存取 | 「有待核實」 |
留意常見的「升格」:
在改寫中保留來源的局限。如原文說的是「某一個城市的受訪者」,便在句子和工作表中都保留這個界線。
如模型提供了引述,便在來源中搜尋確實的措辭,並確認附近的句子沒有反轉其含義。簡短的摘錄較容易審核,也較不容易超出發布者的轉載政策。如找不到這段引述,便改為清楚標示的轉述,或把該主張標示為無依據。
轉述方面,比較主語、動詞、數字、日期、條件和結論。把「可能」改成「確實」這類小改動,便可能改變一項操作指示的風險。可以要求模型列出差異或被改動的限定語,但最終的比較要由你親自完成。
在工作文件中使用一張精簡的主張/證據表:
| ID | 主張 | 來源 | 已檢查的段落 | 結果 | 局限 | 負責人 |
|---|---|---|---|---|---|---|
| C1 | 該政策減少了通報的欺詐 | 官方評估,第 8 頁 | 「……」 | 部分支持 | 一個地區,六個月 | 分析員 |
| C2 | 結果適用於所有客戶 | 同一評估 | 沒有全體範圍的測試 | 找不到 | 樣本不含新帳戶 | 覆核人 |
負責人一欄能防止工作表變成裝飾性的附錄。把未解決的列交給一位具名的覆核人,在覆核人結案前,不要把它們寫進摘要。
健康、法律、金融、僱傭、安全、身份或正式環境變更,要求第一手來源和一位負責的人手覆核者。如來源無法存取、已經過時,或只是間接相關,便停下來,要求更好的證據。NIST 的生成式 AI 風險概況強調記錄風險、局限和人手監督,而不是把生成的文字當作不容置疑的權威。[2]
使用發布者的搜尋或網站導覽找到現行來源。記錄這項不符之處,並從草稿刪除模型產生的 URL。絕不要靠猜測一個相近的路徑來修正失效的引用。
拆分主張,並詢問該來源支持的是哪一句。只有當第二個來源涵蓋一個不同的命題時,才加入它;不要在沒有提高涵蓋範圍的情況下堆砌參考文獻。
由周圍的段落補上群組、日期、方法或置信區間。如這個局限改變了結論,便改寫主張,而不是把細節藏在註腳。
把搜尋摘要當作發掘線索。開啟頁面,確認發布者和日期,並引用頁面本身。搜尋排名不能證明權威。
重申輸出約定,並要求加入一個核實狀態欄。如它仍然填補空白,便把回答移入「未核實」隊列,並在模型以外核實這些主張。
在發布或按 AI 輔助的回答採取行動前:
團隊方面,把工作表與草稿一併保存,並請第二個人抽查風險最高的幾列。目的不是令每一句都聽來很審慎,而是令推理過程可以追溯。
可靠的 AI 引用來自一套可重複的檢查,而不是某個特別的提示詞。界定主張,索取完整的來源紀錄,開啟原文,把段落與措辭對照,保留局限,並把未解決的列交給一位人手負責人。
要求提供來源標題、發布者、日期、穩定的 URL、支持的段落或章節,以及局限說明。再加上核實狀態,令欠缺的證據清楚顯示,而不是被悄悄略去。
細閱被引用的段落及其上下文。把對象、量度、日期、群組、定義和限定語,與你打算發布的句子逐一對照。
不一定。權威令一個來源值得審視,但並不自動具決定性。檢查它的方法、範圍、日期和局限;決策重要時,再與另一個第一手來源比較。
通常應把它從結論中刪除,或標示為未經核實的線索。只有在指派了專人尋找和評估欠缺的證據時,才把它保留在研究隊列中。
它可以協助發現不一致之處,但不能代替你開啟來源。把另一個模型當作審核輔助工具,第一手來源的核查仍在模型以外完成。
沒有通用的數目。使用足夠的權威來源,涵蓋各項主張及其重要局限。一個出色的第一手來源,可能勝過五個不相關的連結。
記錄引用和存取限制,然後尋找合法的公開摘要、資料庫副本,或能查看全文的合資格覆核者。如把摘要當作等同全文,便必須說明。
來源:
Sources checked 2026 年 8 月 23 日。
延伸閱讀:
註冊即可免費體驗全部高級功能。
*只限新用戶;每位用戶只可獲得一次試用。