如何用 AI 規劃審計抽樣而不捏造證據:總體、選樣與替換

如何用 AI 規劃審計抽樣而不捏造證據:總體、選樣與替換

Olivia Park
2026年9月6日· 10 分鐘讀完

要用 AI 規劃審計抽樣而不捏造證據,在揀選任何項目之前,先界定審計目標、總體、抽樣單位、期間、納入規則、偏差、方法、樣本量決定權、選樣機制、替換規則和結論界線。AI 可以整理計劃、檢查欠缺的欄位;它不得捏造總體紀錄、選樣結果、測試工作、例外或結論。

由負責任的 AI 流程開始,但專業判斷和證據保管始終由審計團隊負責。抽樣計劃不是審計證據,被選中的項目亦不等於已測試的項目。

關鍵要點

  • 把樣本綁定到一個審計目標和一個經核實的總體。
  • 決定樣本量之前,先界定抽樣單位和偏差。
  • 寫明統計或非統計選擇的合資格負責人。
  • 保留總體快照、隨機種子或選樣紀錄,以及每一次替換。
  • 結論只限於方法、總體、期間和實際執行的工作。

甚麼是用 AI 規劃審計抽樣而不捏造證據?

審計抽樣計劃說明:為何要審查一個子集、它代表哪個完整的總體、如何揀選項目、審計人員會測試甚麼、如何評價偏差,以及該方法能支持哪些結論。計劃先於選樣和測試。

美國政府問責署(GAO)的《財務審計手冊》為聯邦財務報表審計提供方法和工具,包括計劃和紀錄方面的考慮。[1]其審計抽樣指引討論了目標、總體、抽樣單位、選樣、評價和紀錄。[2]請採用你的委聘所要求的準則和方法;這些參考資料不能取代它們。

把抽樣計劃與實驗計劃分開。實驗透過分配或比較條件來估計效應;審計抽樣則是在既定的保證方法下,從現有總體揀選項目,為某個審計目標取得證據。

如何定義目標與總體?

步驟 1:寫明目標與認定

寫出一個精確的問題。「審查發票」並不足夠。「確定本期內記錄的已批准採購發票,在入帳前是否有規定的三單配對證據」則明確了總體、事件、控制和時間關係。

記錄委聘 ID、審計範疇、目標、相關認定或控制、準則、期間、風險評估、依賴策略、預期證據、負責的審計人員、覆核人和計劃中的結論。如果一次選樣要服務多個目標,便記錄同一總體和抽樣單位是否適合每個目標。不要只因紀錄方便便重用樣本。

把已知的不確定性和後果連繫到風險登記冊流程,但不要讓風險標籤取代委聘的抽樣方法。

步驟 2:定義並證明總體

描述選樣所依據的總體:來源系統、報表或查詢、實體、帳戶或流程、起訖日期、納入和排除規則、狀態篩選條件以及快照時間戳。在相關時,記錄預期和實際的紀錄數目以及控制總額。

在依賴選樣之前,必須先測試總體的完整性和準確性。按情況把擷取結果與獨立的分類帳、來源報表、編號序列、控制總額或系統紀錄核對。調查欠缺的期間、重複的 ID、空鍵、遲來的項目、撥回以及篩選條件的影響。

使用資料驗證清單做格式和完整性檢查,但要記住:語法上有效的行,仍可能遺漏部分審計總體。如果無法證明總體對該目標屬完整,便停止,或在適用的方法下修訂做法。

AI 工具不得填補欠缺的紀錄、估算被遺漏的總體規模,亦不得因某份匯出資料的總數看來合理,便把這份方便取得的資料當作完整總體。

如何定義單位、偏差、方法?

步驟 3:定義抽樣單位和選樣框

抽樣單位是可供揀選的單一項目:交易、發票、付款、日記帳分錄、一次控制執行、一日、一名用戶、一個批次或其他既定單位。單位應與將要測試的內容,以及偏差或錯報的評價方式一致。

區分:

概念例子
總體紀錄已批准交易擷取結果中的一行
抽樣單位一次發票審批事件
證據包發票、審批、收貨單和系統紀錄
測試實例審計人員就該單位記錄的程序和結果

如果一張發票有多個審批步驟,便要訂明單位是發票、每一次審批,還是一次控制執行。否則分母和偏差率都可能失去意義。

以唯一 ID 建立一個穩定的選樣框。凍結其內容和排序,記錄擷取方法和時間戳,並防止選樣後的修改改變某個索引所指向的項目。

步驟 4:預先定義偏差和邊界案例

在測試之前寫好甚麼情況算偏差,包括必需的屬性、時間、獲授權的證據、容許的例外、欠缺證據的處理方式,以及由誰解決含糊之處。就實質性抽樣而言,按適用的方法界定錯報的量度方式和相關的可容忍限額。

例子應針對具體委聘:

  • 入帳前欠缺必需的審批;
  • 審批由無權的角色執行;
  • 證據存在,但無法與所選單位對應;
  • 控制在容許的時間之後才執行;
  • 有紀錄、已批准的例外符合政策規定;
  • 項目已作廢、撥回、重複,或不在期間之內。

不要指示 AI 判斷不尋常的證據是否等同。由審計人員套用準則並記錄專業判斷。欠缺的證據不應被改寫成「控制很可能已執行」的證據。

步驟 5:選擇統計或非統計方法

統計抽樣使用以概率為本的選樣和統計評價,因此可以在所選方法下量度抽樣風險。非統計抽樣同樣要求具代表性、無偏的選樣和專業評價,但不能只因用了隨機函數,便聲稱可以用統計方法量度抽樣風險。

記錄方法、理由、風險假設、預期偏差或錯報的依據、可容忍率或金額、適用時的信賴或保證參數、分層、個別重大項目的處理,以及批准設計的合資格負責人。

GAO 的統計抽樣資料解釋了概率抽樣的概念和樣本設計的考慮。[3]不要未經核實其假設、總體、目標、預期誤差、可容忍誤差和所需信賴水平,便從通用表格照搬樣本量。AI 不得選擇這些專業參數。

如何定量並重現選樣?

步驟 6:合資格人員決定樣本量

樣本量負責人應套用委聘所適用的準則、審計方法、風險評估、依賴計劃、總體特徵、預期偏差、可容忍偏差或錯報,以及計劃中的評價方式。記錄所用的工具、公式、表格、版本、輸入、輸出、調整、理由、編製人和覆核人。

把以下決定分開:

  1. 因金額、風險或異常特徵而必選的項目;
  2. 需要抽樣的餘下總體;
  3. 採用不同選樣或評價規則的層;
  4. 概率樣本或非統計樣本;
  5. 為其他目的而檢查的額外項目。

測試高風險項目很有用,但並不自動支持有關餘下總體的結論。把針對性揀選與代表性抽樣分開標示。

步驟 7:記錄可重現選樣

至於隨機選樣,使用已批准的確定性工具,並保留總體快照、唯一 ID 欄、排序規則、演算法或工具版本、隨機種子、要求的數目、選中的 ID、執行時間戳、操作人員和輸出檔案。以凍結的輸入重新執行,應得出相同的選樣結果。

至於系統選樣,記錄間距、隨機起點、排序方式、總體規模以及最後一個間距的處理方式。檢查總體排序中有否可能造成偏差的周期性規律。至於貨幣單位抽樣或其他專門方法,記錄相關的累計值和選樣邏輯。

AI 可以草擬供審閱的程式碼,但在檢查依賴、索引、重複處理、種子行為和輸出之前,不要在敏感資料上執行產生的選樣程式碼。獨立確認每個選中的 ID 在凍結的選樣框中恰好出現一次。

檢查這份抽樣計劃紀錄中欠缺或不一致的欄位。不要
建立總體行、選擇參數、產生選中的 ID、替換項目、
描述測試工作或推斷結果。只報告需要合資格審計人員
解決的矛盾和問題。

如何處理替換與測試狀態?

步驟 8:預先規定替換與缺證處理

項目不便測試或測試失敗,都不是替換它的理由。預先訂明:紀錄無法取得、在選樣框中重複、超出記錄的總體範圍、已損壞、已作廢,或只能連繫到不完整證據時,應怎樣處理。保留原來的選樣、原因、決定權限、替換方法以及對評價的影響。

替換可能因剔除困難個案而令樣本出現偏差。在不少設計中,欠缺證據本身便與測試相關。依循所要求的方法,把不確定之處上報,而不是要 AI 找一條「類似」的紀錄。

維持一份例外紀錄,記下原來的選樣 ID、問題、證據、處置、覆核人、(如獲准許)替換 ID、選樣方法和修訂版本。切勿從歷史紀錄中刪除原先選中的項目。

步驟 9:分開選樣、測試和評價

使用不同的狀態,例如 Selected、Evidence requested、Evidence received、Testing in progress、Deviation、No deviation、Consultation 和 Reviewed。每個測試結果都應寫明所選單位、程序、準則、證據定位、執行人、日期、發現、判斷和覆核人。

模型可以整理審計人員撰寫的筆記,或找出欠缺的欄位。它絕不能產生證據中不存在的簽署、截圖、工作單、控制執行紀錄、測試步驟、偏差或「通過」結果。NIST 描述了生成式 AI 的虛構內容和資訊完整性風險,並強調管治、量度和人手監督。[4]

使用事實核查流程把 AI 輔助撰寫的文字拆解成主張,再把每項主張與工作底稿比對。以第二個模型審查第一個模型,並不構成獨立的審計證據。

如何評價與保留軌跡?

步驟 10:只作設計支援的推斷

在所選方法下評價偏差或錯報,包括其定性特徵和可能的系統性原因。考慮抽樣風險、非抽樣風險、總體的有效性、必選項目中的偏差、未解決的證據、替換、分層,以及計劃中的依賴是否仍然恰當。

不要把針對性或隨意的選樣當作統計樣本來推斷總體。實際結論是「在已測試的項目中未發現偏差」時,不要說「沒有問題」。不要推及超出該實體、總體、期間、認定和程序的範圍。

記錄結論、方法、已測試數目、偏差、未解決的項目、適用時的定量評價、定性考慮、範圍限制、諮詢、編製人、覆核人以及與報告的連繫。如果證據不支持計劃中的結論,便按適用準則修改工作或報告該限制。

步驟 11:保留軌跡與變更

保留已批准的計劃、總體擷取邏輯、總體快照、完整性工作、樣本量紀錄、隨機種子或選樣紀錄、選中的 ID、證據要求、測試工作、例外、替換、評價、諮詢、覆核以及最終連繫。採用適合審計證據的存取控制和保留規則。

選樣之後的任何變更,都應說明改了甚麼、為何改、由誰批准、影響了哪些紀錄,以及設計或結論是否需要重新審視。切勿在看到例外之後重新產生一個「更乾淨」的樣本。

檢查清單

  • 目標、準則、認定、期間和計劃中的結論都很精確。
  • 已記錄總體來源、篩選條件、快照、完整性和準確性。
  • 抽樣單位和唯一選樣框與測試內容一致。
  • 偏差、錯報、例外和欠缺證據都已預先界定。
  • 統計或非統計方法及其理由已獲批准。
  • 已記錄合資格的樣本量負責人和輸入。
  • 隨機種子、演算法、排序、選中的 ID 和執行紀錄可以重現。
  • 替換和無法取得項目的規則在測試前已寫好。
  • 選樣、收到證據、測試和評價的狀態保持分開。
  • 結論只限於實際的設計和已完成的工作。

總結

  • 圍繞一個精確的審計目標設計樣本。
  • 由總體揀選之前,先核實總體。
  • 選擇方法或樣本量之前,先界定單位和偏差。
  • 保留可重現的選樣和替換紀錄。
  • 切勿讓 AI 製造證據或測試結果。
  • 只陳述設計和工作底稿能支持的結論。

常見問題

AI 能決定審計樣本量嗎?

它可以整理輸入或檢查已記錄的計算,但必須由合資格的負責人在適用的審計方法下選擇方法、參數、假設和樣本量。

隨機樣本一定是統計抽樣嗎?

不一定。統計抽樣需要在既定設計中使用以概率為本的選樣和統計評價。單有一個隨機函數,並不能確立這種方法。

證據不可用時能替換嗎?

只有在符合方法、預先訂明並獲批准的規則下才可以。保留原來的選樣,並評估欠缺證據本身是否構成偏差或限制。

被選中和已測試有何區別?

被選中的項目在樣本之中。只有在就已識別的證據執行了有紀錄的程序並經覆核之後,它才算已測試;被選中並不代表有結果。

高風險定向項目能代表總體嗎?

單憑它們本身不能。它們針對特定風險,但並不自動代表餘下總體。要標明其目的和結論界線。

選樣後總體變化怎麼辦?

凍結原來的快照,調查改變原因,並由審計團隊在有紀錄的批准下決定更新、補充還是重新設計樣本。

能讓另一個 AI 驗證第一個 AI 嗎?

不能。模型之間的一致既不是來源證據,亦不是獨立的審計工作。請審查實際的紀錄、程序、準則和工作底稿。

零偏差如何表述?

說明在有紀錄的程序下,已測試的樣本中未發現偏差。任何更廣泛的推斷都必須依循抽樣設計和適用的方法。

免責聲明: 本文提供的是一般性的教育資訊,不構成審計、鑒證、會計、統計、法律或監管意見。必須由合資格的專業人員按適用準則選擇方法、作出判斷、執行程序、評價證據並批准結論。

來源

  1. U.S. Government Accountability Office — Financial Audit Manual — https://www.gao.gov/financial-audit-manual
  2. U.S. Government Accountability Office — Financial Audit Manual, Volume 1 (2024) — https://www.gao.gov/assets/gao-24-107278.pdf
  3. U.S. Government Accountability Office — Using Statistical Sampling — https://www.gao.gov/assets/pemd-10.1.6.pdf
  4. NIST — Artificial Intelligence Risk Management Framework: Generative AI Profile — https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence

Sources checked 2026 年 9 月 6 日。

延伸閱讀

開啟 3 天免費試用

註冊即可免費體驗全部高級功能。

*只限新用戶;每位用戶只可獲得一次試用。

如何用 AI 規劃審計抽樣而不捏造證據:總體、選樣與替換 | AethoVPN