如何核驗 AI 答案:逐項拆分主張,回到原始來源查證據

如何核驗 AI 答案:逐項拆分主張,回到原始來源查證據

Olivia Park
2026年8月21日· 更新於 2026年8月22日· 8 分鐘讀完

如何核驗 AI 答案?一次只查一項主張最容易。AI 的答案可能聽來十分肯定,實際上卻錯誤、不完整、已經過時,或所附引用根本沒有說出答案所聲稱的內容。不要憑語氣判斷一段文字。

關鍵要點

  • 核驗前先把回覆拆成獨立主張。
  • 為每項主張配對權威而範圍相符的來源。
  • 親自核對日期、數字、措辭和矛盾之處。
  • 標出沒有根據的主張,不要用流暢文字填補空白。

**示例任務(截圖中未顯示):**查看供應商現行說明頁是否支持某項所述功能;如果來源沒有提及,就把該主張標記為 not verified。

**核心規則:**有引用,不等於引用支持該主張。

1. 學會如何核驗 AI 答案,先把答案拆成主張

把答案複製到表格,將事實、日期、數字、建議和詮釋分開。一句含三個分句的句子,可能包含三項獨立主張。在弄清結論依賴哪些證據之前,不要急於核驗結論。

主張風險所需證據結果
產品支援某項功能現行產品事實官方文件已核實/未核實
某個數字有所改變時效性事實註明日期的原始來源日期確認/已過時
某項政策適用於某群體範圍敏感的事實政策及其例外適用/不適用
某項建議是安全的有後果的判斷專業指引和具體情況人工覆核

2. 哪些主張應該先核驗?

先查高風險或變化快的主張:健康、法律、財務、保安、帳戶資格、價格、軟件行為和地區供應情況。一項日期明確的歷史事實,通常不及一項現行支援政策那樣急需覆核。

可以請工具標出不確定之處,但不要把它的標籤當作證據。如果答案涉及現行日期、版本、配額、國家名單或法律要求,就親自向供應商、監管機構或原研究人員查證。

3. 甚麼才算原始來源?

優先採用原始來源:官方說明頁、規格、政策、數據集、論文、存檔文件或當事方的直接聲明。搜尋摘要和二手撮要可以幫你找到來源,但它們本身不是來源。

檢查四條界線:

  1. 身份:是否同一產品、機構、版本或人物?
  2. 範圍:是否適用於這個帳戶、國家、計劃、年齡組別或介面?
  3. 日期:答案寫成時,這個來源是否仍屬現行?
  4. 強度:來源是在證明這項主張,還是只提及相關話題?

如果頁面連結到另一項政策,就跟着連結打開。在筆記中記下 URL 和存取日期。

4. 比較措辭而不只是關鍵字

閱讀來源中相關段落的前後文。留意以下常見錯誤:

  • 「可能」被改寫成「將會」。
  • 試用、預覽或只限某地區的功能被寫成普遍適用。
  • 研究結果被寫成保證。
  • 來源中的例子被寫成一般規則。
  • 舊版本或已封存頁面被當作現行內容。

來源含糊時,保留這種不確定,不要硬要得出「是/否」的答案。

5. 記錄證據和未決事項

使用一份小型證據記錄:

Claim:
Source URL:
Relevant passage:
Published or updated date:
Scope and exceptions:
Status: verified / partly supported / not verified
Next action:

不要只為了問答案是否正確,就把機密文件貼進 AI 工具。AI 工具私隱風險指南說明了分享證據前如何脫敏。

簡短證據記錄

為每項主張記下來源證明了甚麼、留下了甚麼空白,以及下一步怎樣做。精簡的記錄可以防止某個引用被搬到其日期、人口、產品版本或司法管轄區以外使用。它亦令日後覆核更快:其他人可以重做檢查,毋須信任原本的答案或你對頁面的記憶。

6. 重新檢查 AI 生成的引用

請 AI 交回確切的來源 URL,以及它認為該來源支持的主張。然後親自打開該 URL。虛構的標題、失效的連結或看似可信的域名都屬於失敗,而不是小小的格式問題。

需要可重複的研究流程,可參考如何安全地使用 AI 進行研究。想讓答案一開始就揭示不確定性,可參考令缺口浮現的提示詞寫法。

7. 證據不足時應該怎樣做?

如果答案得不到證據支持,就不要據此發布內容、執行程式碼、付款、更改帳戶,或作出健康、法律方面的決定。寫上「未核實」,諮詢合資格人士,或回到原始來源。

8. 檢查主張的形狀

不同主張需要不同證據。關於產品設定的句子,應指向該產品的現行說明頁;關於科學效應的句子,應列明研究、人口、方法和局限;關於法律的句子,應列明司法管轄區和官方條文。不要因為某個一般來源含有相同關鍵字就接納它。

數字需要額外多核一次。確認單位、分母、時段、進位方式,以及該數值是平均值、估算、門檻還是保證。「最高可達」不等於「通常」,沒有註明人口的百分比也可能誤導。如果答案換算了某個數字,就用計算機或小型腳本重算一次,並把原數值放在結果旁邊。

操作指示除了核對真偽,還需要安全檢查。一條指令即使準確抄自文件,也可能不適合你的作業系統、權限、版本或資料。先在可棄置的環境中測試。如果操作會更改帳戶、刪除資料、發送訊息或影響生產環境,即使來源權威,也要設定人工批准步驟。

9. 走完一個完整例子

假設某個答案說:「這個計劃向所有用戶提供功能 X,提示詞保存三十天,而且在所有地區都可使用。」這不是一項事實,而應拆成三列:

主張最低核對
計劃包含功能 X現行計劃文件及其例外
提示詞保存三十天私隱或保留政策,以及帳戶和工作區範圍
服務在所有地區可用支援地區列表和帳戶資格規則

第一個來源或許支持該功能,卻對保留期隻字不提。私隱政策描述的可能只是預設設定,而企業工作區另有不同的控制。供應地區頁面或許列出支援的國家,卻不能證明每個帳戶都可以登記。把每項結果分開記錄:已核實、部分支持、未核實或不適用。

如果答案附有引用,就比較確切措辭。寫着「部分客戶可能可以使用」的頁面,並不支持「所有用戶都可使用」。描述某項設定的來源,也不能證明你的帳戶已啟用該設定。把這些界線寫進證據記錄,不要在最終文稿中把它們磨平。

10. 處理衝突時不要取平均

兩個可信來源可能互相矛盾,因為它們描述的是不同版本、日期、地區、人口或定義。先以中立的文字寫下矛盾之處。然後判斷哪個來源對這個問題具權威性,以及哪個較新或較具體。法律定義可能由監管機構決定;現行介面以產品說明頁為準;某項研究的量度結果以該研究本身為準。

如果矛盾仍未解決,就把兩種說法連同各自範圍一併保留,並說明怎樣才能解決。不要把法律要求取平均、推斷出產品保證,或挑選較方便的數字。遇到影響重大的決定,諮詢負責的專家,並讓批准決定的人看到這個未決問題。

11. 保護證據鏈

保留原本的答案、拆出的主張、你打開過的 URL、相關段落、發布或更新日期,以及最終狀態。只保存必要的最少文字,並為個人或機密資料脫敏。截圖可以顯示你當時看到的內容,但 URL 加上引述段落更便於審核推理;頁面可能改動時,兩者都要保存。

來源無法存取時,要如實說明。不要請 AI 憑記憶重構付費牆後的文章、私人檔案或已消失的頁面。把該主張標為未決,再尋找可存取的原始來源或合資格的覆核人。核驗的目的不是製作一份看似完整的表格,而是顯示哪些主張有根據、哪些沒有。

12. 核對引用和轉換

簡短引語應與來源完全一致,包括說話者和上下文的限定語。如果你翻譯、縮短或合併了多段文字,就把結果標為轉述。不要為來源從未說過的句子加上引號。至於程式碼、公式和結構化數據,要對照原始字元並執行安全測試,不要只看外觀是否相似。

答案綜合多個來源時,要求它為每個要點保留來源界線。一段混合兩項研究的文字,可能令其中一項研究看似支持另一項的結論。把主張拆開,分別引用,並註明哪些證據屬間接。多做這些記錄,比日後修補一個自信卻無從追查的結論更快。

把主張表與最終文稿放在一起,讓其他覆核人毋須依賴模型的措辭或自信,也能重現這個決定。

它應一直作為證據鏈的一部分,供日後更新和審計之用。

開始前先訂立清晰的決策門檻。低風險的解釋,一個現行原始來源或許已足夠;健康、法律、財務、保安或帳戶方面的決定,則需要更強的證據和合資格的覆核人。未達門檻時,就讓該主張保持未決,不要用一個看似合理的答案填補空白。清晰可見的停止規則,本身就是正確核驗的一部分,而不是流程失敗的跡象。

十分鐘核驗流程

  1. 拆出主張。
  2. 按危害程度和時效性排序。
  3. 為每項重要主張找到原始來源。
  4. 核對身份、範圍、日期和措辭。
  5. 記錄證據和未決事項。
  6. 只批准經得起覆核的主張。

總結

核驗是一套證據流程,而不是信心測試。把答案拆成主張,按風險排序,打開原始來源,比較確切措辭,記錄日期和範圍,欠缺支持時就停下來。

上述核驗方法以所引用的 AI 風險和資訊評估指引為依據。[1][2][3]

常見問題

有引用就能相信答案嗎?

不能。引用必須真實存在、仍屬現行、範圍相符,而且足以支持該項確切主張。

兩個來源互相矛盾怎麼辦?

記錄矛盾,比較日期和範圍,優先採用對該問題具權威性的來源;決定後果重大時,諮詢專家。

能讓 AI 自己核驗嗎?

可以把它當作第二輪檢查,但這不能取代你親自打開來源。

怎樣核對 AI 答案中的數字?

找出註明日期的原始來源,確認單位和時段,並檢查該數字是估算、平均值、上限還是保證。

未核驗的段落應怎樣處理?

刪除它、標明未核實,或圍繞你能證實的主張重寫。不要用肯定的語氣掩飾不確定性。


免責聲明:本文只供一般資訊參考,不構成法律、醫療、財務或專業建議。高風險決定必須由合資格人士覆核。

來源:

  1. NIST — AI Risk Management Framework — https://www.nist.gov/itl/ai-risk-management-framework
  2. NIST — Generative AI Profile — https://doi.org/10.6028/NIST.AI.600-1
  3. Google — Search guidance about evaluating information — https://support.google.com/websearch/answer/134479?hl=en

Sources checked 2026 年 8 月 22 日。


延伸閱讀:

開啟 3 天免費試用

註冊即可免費體驗全部高級功能。

*只限新用戶;每位用戶只可獲得一次試用。

如何核驗 AI 答案:逐項拆分主張,回到原始來源查證據 | AethoVPN