开启 3 天免费试用
注册即可免费体验全部高级功能。
*仅限新用户;每位用户只能获得一次试用。


要用 AI 规划审计抽样而不编造证据,在选取任何项目之前,先定义审计目标、总体、抽样单位、期间、纳入规则、偏差、方法、样本量决定权、选样机制、替换规则和结论边界。AI 可以整理计划、检查缺漏字段;它不得编造总体记录、选样结果、测试工作、例外或结论。
从负责任的 AI 流程开始,但职业判断和证据保管始终由审计团队负责。抽样计划不是审计证据,被选中的项目也不等于已测试的项目。
关键要点
- 把样本绑定到一个审计目标和一个经核实的总体。
- 在决定样本量之前,先定义抽样单位和偏差。
- 写明统计或非统计选择的合格负责人。
- 保存总体快照、随机种子或选样记录,以及每一次替换。
- 结论只限于方法、总体、期间和实际执行的工作。
审计抽样计划说明:为什么要审查一个子集、它代表哪个完整的总体、如何选取项目、审计人员将测试什么、如何评价偏差,以及该方法能够支持哪些结论。计划先于选样和测试。
美国政府问责署(GAO)的《财务审计手册》为联邦财务报表审计提供了方法和工具,包括计划和记录方面的考量。[1]其审计抽样指引讨论了目标、总体、抽样单位、选样、评价和记录。[2]请采用你的业务所要求的准则和方法;这些参考资料不能取代它们。
把抽样计划与实验计划区分开。实验通过分配或比较条件来估计效应;审计抽样则是在既定的保证方法下,从现有总体中选取项目,为某个审计目标获取证据。
写出一个精确的问题。“审查发票”是不够的。“确定本期内记录的已批准采购发票,在入账前是否有要求的三单匹配证据”则明确了总体、事件、控制和时间关系。
记录业务 ID、审计领域、目标、相关认定或控制、标准、期间、风险评估、依赖策略、预期证据、负责的审计人员、复核人和计划中的结论。如果一次选样要服务多个目标,就记录同一总体和抽样单位是否适合每一个目标。不要仅仅因为记录方便就重复使用样本。
把已知的不确定性和后果关联到风险登记册流程,但不要让风险标签取代业务的抽样方法。
描述选样所依据的总体:来源系统、报表或查询、实体、账户或流程、起止日期、纳入和排除规则、状态筛选条件以及快照时间戳。在相关时,记录预期和实际的记录数以及控制总额。
在依赖选样之前,必须先测试总体的完整性和准确性。视情况将提取结果与独立的分类账、源报表、编号序列、控制总额或系统记录核对。调查缺失的期间、重复的 ID、空键、迟到的条目、冲回以及筛选条件的影响。
使用数据验证清单做格式和完整性检查,但要记住:语法上有效的行,仍可能遗漏部分审计总体。如果无法证明总体对该目标是完整的,就停止,或在适用的方法下修订做法。
AI 工具不得填补缺失的记录、估算被遗漏的总体规模,也不得因为某份导出数据的合计看起来合理,就把这份方便取得的数据当作完整的总体。
抽样单位是可供选取的单个项目:交易、发票、付款、日记账分录、一次控制执行、一天、一名用户、一个批次或其他既定单位。单位应与将要测试的内容,以及偏差或错报的评价方式保持一致。
区分:
| 概念 | 示例 |
|---|---|
| 总体记录 | 获批交易提取结果中的一行 |
| 抽样单位 | 一次发票审批事件 |
| 证据包 | 发票、审批、收货单和系统历史 |
| 测试实例 | 审计人员针对该单位记录的程序和结果 |
如果一张发票有多个审批步骤,就要规定单位是发票、每一次审批,还是一次控制执行。否则分母和偏差率都可能失去意义。
用唯一 ID 建立一个稳定的选样框。冻结其内容和排序,记录提取方法和时间戳,并防止选样后的修改改变某个索引所指向的项目。
在测试之前写好什么情况算偏差,包括必需的属性、时间、获授权的证据、允许的例外、缺失证据的处理方式,以及由谁解决含糊之处。对于实质性抽样,按照适用的方法定义错报的衡量方式和相关的可容忍限额。
示例应针对具体业务:
不要指示 AI 判断不寻常的证据是否等效。由审计人员应用标准并记录职业判断。缺失的证据不应被改写成“控制很可能已执行”的证据。
统计抽样使用基于概率的选样和统计评价,因此可以在所选方法下衡量抽样风险。非统计抽样同样要求有代表性、无偏的选样和职业评价,但不能仅仅因为用了随机函数,就声称可以用统计方法衡量抽样风险。
记录方法、理由、风险假设、预期偏差或错报的依据、可容忍率或金额、适用时的置信或保证参数、分层、对个别重大项目的处理,以及批准设计的合格负责人。
GAO 的统计抽样材料解释了概率抽样的概念和样本设计的考量。[3]不要未经核实其假设、总体、目标、预期误差、可容忍误差和所需置信度,就从通用表格中照搬样本量。AI 不得选择这些职业参数。
样本量负责人应应用业务所适用的准则、审计方法、风险评估、依赖计划、总体特征、预期偏差、可容忍偏差或错报,以及计划中的评价方式。记录所用的工具、公式、表格、版本、输入、输出、调整、理由、编制人和复核人。
把以下决定分开:
测试高风险项目很有用,但并不自动支持关于剩余总体的结论。把定向选取与代表性抽样分开标注。
对于随机选样,使用获批的确定性工具,并保存总体快照、唯一 ID 列、排序规则、算法或工具版本、随机种子、请求的数量、选中的 ID、执行时间戳、操作人员和输出文件。用冻结的输入重新运行,应得到相同的选样结果。
对于系统选样,记录间隔、随机起点、排序方式、总体规模以及最后一个间隔的处理方式。检查总体排序中是否存在可能造成偏差的周期性规律。对于货币单位抽样或其他专门方法,记录相关的累计值和选样逻辑。
AI 可以起草供审阅的代码,但在检查依赖、索引、重复处理、种子行为和输出之前,不要在敏感数据上运行生成的选样代码。独立确认每个选中的 ID 在冻结的选样框中恰好出现一次。
检查这份抽样计划记录中缺失或不一致的字段。不要
创建总体行、选择参数、生成选中的 ID、替换项目、
描述测试工作或推断结果。只报告需要合格审计人员
解决的矛盾和问题。
项目不方便测试或测试失败,都不是替换它的理由。预先规定:记录无法获取、在选样框中重复、超出记录的总体范围、已损坏、已作废,或只能关联到不完整证据时,应当怎么办。保留原始选样、原因、决定权限、替换方法以及对评价的影响。
替换可能因剔除困难案例而使样本产生偏差。在许多设计中,缺失证据本身就与测试相关。遵循所要求的方法,把不确定之处上报,而不是让 AI 找一条“类似的”记录。
维护一份例外日志,记录原始选样 ID、问题、证据、处置、复核人、(若允许)替换 ID、选样方法和修订版本。绝不要从历史记录中删除原先选中的项目。
使用不同的状态,例如 Selected、Evidence requested、Evidence received、Testing in progress、Deviation、No deviation、Consultation 和 Reviewed。每个测试结果都应写明所选单位、程序、标准、证据定位、执行人、日期、发现、判断和复核人。
模型可以整理审计人员撰写的笔记,或找出缺失的字段。它绝不能生成证据中不存在的签名、截图、工单、控制执行记录、测试步骤、偏差或“通过”结果。NIST 描述了生成式 AI 的虚构内容和信息完整性风险,并强调治理、衡量和人工监督。[4]
使用事实核查流程把 AI 辅助撰写的文字拆解成主张,再把每项主张与工作底稿比对。用第二个模型审查第一个模型,并不构成独立的审计证据。
在所选方法下评价偏差或错报,包括其定性特征和可能的系统性原因。考虑抽样风险、非抽样风险、总体的有效性、必选项目中的偏差、尚未解决的证据、替换、分层,以及计划中的依赖是否仍然合适。
不要把定向或随意的选样当作统计样本来推断总体。实际结论是“在已测试的项目中未发现偏差”时,不要说“没有问题”。不要推广到超出该实体、总体、期间、认定和程序的范围。
记录结论、方法、已测试数量、偏差、未解决的项目、适用时的定量评价、定性考量、范围限制、咨询、编制人、复核人以及与报告的关联。如果证据不支持计划中的结论,就按适用准则修改工作或报告该限制。
保留获批的计划、总体提取逻辑、总体快照、完整性工作、样本量记录、随机种子或选样记录、选中的 ID、证据请求、测试工作、例外、替换、评价、咨询、复核以及最终关联。采用适合审计证据的访问控制和保留规则。
选样之后的任何变更,都应说明改了什么、为什么改、由谁批准、影响了哪些记录,以及设计或结论是否需要重新审视。绝不要在看到例外之后重新生成一个“更干净”的样本。
它可以整理输入或检查已记录的计算,但必须由合格的负责人在适用的审计方法下选择方法、参数、假设和样本量。
不一定。统计抽样需要在既定设计中使用基于概率的选样和统计评价。仅有一个随机函数,并不能确立这种方法。
只有在符合方法、预先规定并获批的规则下才可以。保留原始选样,并评估缺失证据本身是否构成偏差或限制。
被选中的项目在样本之中。只有在针对已识别的证据执行了记录在案的程序并经复核之后,它才算已测试;被选中并不意味着有了结果。
仅凭它们本身不能。它们针对特定风险,但并不自动代表剩余总体。要标明其目的和结论边界。
冻结原始快照,调查变化原因,并由审计团队在有记录的批准下决定是更新、补充还是重新设计样本。
不能。模型之间的一致既不是来源证据,也不是独立的审计工作。请审查实际的记录、程序、标准和工作底稿。
说明在记录在案的程序下,已测试的样本中未发现偏差。任何更广泛的推断都必须遵循抽样设计和适用的方法。
免责声明: 本文提供的是一般性的教育信息,不构成审计、鉴证、会计、统计、法律或监管建议。必须由合格的专业人员按照适用准则选择方法、作出判断、执行程序、评价证据并批准结论。
Sources checked 2026 年 9 月 6 日。
注册即可免费体验全部高级功能。
*仅限新用户;每位用户只能获得一次试用。