安全使用 AI Agent 的操作清单:最小权限、审批与撤权

安全使用 AI Agent 的操作清单:最小权限、审批与撤权

Olivia Park
2026年8月24日· 9 分钟阅读

要安全使用 AI Agent,应当只授予一个明确任务所需的最少数据、工具与权限,把执行限制在隔离边界内,并在产生重大副作用前经过可信审批。检索到的文档、消息、网页、工具输出和历史记忆都应视为不可信输入;日志、撤权、清理和停止条件则必须掌握在可问责的人或服务所有者手中。

这是一份面向已有 Agent 的操作者指南。若要先理解控制循环,可阅读 AI Agent 是什么;当你准备让 Agent 执行真实任务时,再用本文划定操作边界。

关键要点

  • 用输入、输出、排除项和停止点定义单任务授权边界。
  • 启动前盘点工具、身份、凭据、数据、记忆和网络目的地。
  • 按工具和资源实施最小权限,并分离读取与修改能力。
  • 把外部内容当作数据,绝不能当作授权来源。
  • 预览副作用,通过可信通道批准高影响动作,并保留审计证据。
  • 任务结束或结果不明确时,先核验,再撤权、清理状态或停止。

操作者如何安全使用 AI Agent?

把 Agent 看作一个需要监管的初级服务账号,而不是普通聊天对象。模型可以理解文字指令,但真正决定它能访问哪些文件、API、记录、命令和网络目的地的,必须是模型之外的技术控制。

OWASP 建议只提供最少工具、按工具限制权限、为不同信任级别分离工具集,并对敏感操作实施显式授权。[1] 这些是部署控制,不是只写在提示词里的愿望。

开始前建立操作记录:

字段有边界的示例
目标根据四份指定本地文档起草报告
输入一个目录内的命名只读文件
输出暂存目录中的一份草稿
禁止项邮件、删除、发布、凭据访问、新网络目的地
完成条件草稿存在、来源已映射、无未解决检索错误
停止条件范围变化、不可信指令、权限请求、副作用不明确

如果这张表无法填清,任务还不适合交给 Agent 执行。

第 1 步:盘点所有能力与信任边界

列出 Agent 的工具、连接器、插件、本地路径、网络目的地、服务账号、环境变量、记忆和审批通道。即使某项能力没有出现在任务里,只要已启用,也必须纳入盘点。

每一项都要记录:

  • 可读取、写入、删除、执行、发送、发布或管理哪些内容;
  • 资源范围是一份文件还是整个网盘;
  • 下游实际使用哪个身份;
  • 凭据寿命以及谁负责撤销;
  • 数据分类和保留期限;
  • 可能产生的外部副作用;
  • 操作者可以回读哪些日志。

OWASP 将过度代理能力归因于过多功能、过大权限或过高自主性。[2] 一个只需读邮件的任务,不应因为连接器把收发能力打包在一起而继承发送权限。

不要只靠“禁止”指令

“不要删除任何东西”弱于根本不提供删除工具。移除任务不需要的能力。若平台无法拆分读写权限,应改用更受限的连接器、代理层、一次性环境或人工交接。

AI 隐私风险指南可以帮助你在数据进入上下文前完成分类。与其等数据已被日志、记忆或外部请求复制后再清理,不如事先最小化。

第 2 步:写清单任务授权边界

明确输入、允许的转换、输出位置、资源预算、截止时间和停止条件。避免“管理我的收件箱”“改进这个仓库”或“持续推进项目”这类开放目标,因为它们允许 Agent 自行发明子目标并扩大权限。

一个可靠边界应把提案和执行分开:

  1. 只检查命名资源;
  2. 生成计划和预期副作用预览;
  3. 影响超过预设阈值时停止并请求审批;
  4. 只执行被批准的准确版本;
  5. 回读结果并停止。

若你是在设计自动化本身,请参考 用 AI 自动化重复任务。本文假定流程已存在,只讨论如何安全操作。

第 3 步:按工具、资源和时间授予最小权限

不要复用个人账号或管理员身份,应创建任务专用权限。把访问限制到指定仓库、文件夹、邮箱、数据库视图、API 动作和目的地,并分离读取与修改。

优先使用短期、窄范围且可独立撤销的凭据。不要把秘密粘贴进提示词,也不要存入长期记忆;应通过平台的受保护机制提供,并确认日志和工具输出不会回显。

文件系统、网络和命令边界要分别设置。OpenAI 将沙箱描述为技术执行边界,将审批描述为跨越边界时的治理机制。[3] 两者互补,不能互相替代。

图中是操作者检查清单,不是某个平台已落实控制的证明。必须回读真实配置和下游身份。

第 4 步:把检索内容和工具输出视为不可信

邮件、工单、网页、仓库文件、文档、API 响应或另一个 Agent 都可能包含看起来像指令的文字。OWASP 要求把外部数据视为不可信,并与真正指令明确分离。[1]

遵守以下规则:

  • 指令只能来自可信任务边界和审批通道;
  • 检索内容需要定界并标记为数据;
  • 内容不能授予工具、改变范围、索取凭据或批准动作;
  • 工具参数在模型之外经过 schema 与 allowlist 校验;
  • URL、路径、收件人、分支、账户 ID 和金额在执行时重新验证;
  • 可疑内容触发停止或隔离,而不是临时绕过。

不要让同一个模型独自判断针对自己的提示注入是否无害。模糊场景应依靠确定性策略检查、受限工具和人工复核。

隔离记忆与上下文

不要把不同用户、客户、项目或信任等级混入同一记忆范围。明确哪些内容可以保留、保留多久、谁能删除;政策允许时,在核验后清除任务临时上下文。

过期记忆中的旧指令可能与恶意新文档一样危险。任务边界不能覆盖当前授权或下游强制策略。

第 5 步:预览每一个重大副作用

在能够真实代表动作时,使用只读检查、dry-run、草稿或 diff 模式。预览应显示准确目标、身份、资源集合、变更、接收方、权限和预期后果。

预览是证据,不是授权。它可能不完整,执行前外部状态也可能变化。审批必须绑定到准确提案版本、范围、目标、身份和有效期。

若要设计严谨的门禁,请参考 带人工审批的 AI 工作流。如果不可信内容可以伪造“批准”,或执行器能够绕过按钮,那么按钮本身没有意义。

第 6 步:高影响动作必须经过可信审批

运行前就设定审批阈值。发送消息、发布内容、修改源码、变更权限、安装软件、访问敏感记录、执行数据库写入、花费资金、部署或删除数据,通常都需要显式复核。

审批者需要一份证据包:

  • 任务和业务所有者;
  • 准确的提案及其不可变版本;
  • 受影响的资源和接收方;
  • 权限和执行身份;
  • 已完成的验证;
  • 预期影响和失败模式;
  • 回滚或恢复路径;
  • 未知项和环境缺口。

只要提案、目标、身份、数据或工具参数改变,就应拒绝或使旧审批过期。绝不能让 Agent 自己批准权限扩张。

第 7 步:通过受限工具执行并验证输出

每一次工具调用都必须由中介层实施资源和参数规则。使用结构化 schema、allowlist、大小限制、timeout、速率限制,并在重试可能重复副作用时提供幂等键或回读核验。

执行 Agent 生成的脚本或命令前,应用 AI 生成代码复核清单,检查依赖、Shell 插值、查询构造、路径、网络访问、清理和错误处理。

超时或断连属于“结果未知”,而不一定是失败。重试重大动作前先检查目标系统;如果第一次其实成功,盲目重放可能重复邮件、扣款、工单或部署。

第 8 步:记录足够证据,但不记录秘密

记录任务 ID、操作者、Agent 和工具版本、策略版本、批准输入、提案身份、审批事件、工具名称、经脱敏的参数证据、结果状态、时间戳和回读结论。删除令牌、个人数据、私密内容和秘密查询参数。

日志应位于 Agent 无法单方面修改的位置。对意外工具或目的地、权限失败、重复重试、异常大输出、策略绕过,以及任务完成后的活动发出告警。

NIST 生成式 AI Profile 用于把可信性考量纳入生成式 AI 的设计、开发、使用和评估。[4] 对操作者而言,既要评估输出,也要评估产生输出的控制环境。

第 9 步:回读、撤权并清理任务状态

执行后,独立查询目标系统或检查最终资源,确认预期副作用只发生一次、目标正确,并且没有额外资源被改变。

随后:

  1. 撤销或让任务凭据过期;
  2. 关闭临时连接器和网络规则;
  3. 按保留策略处理暂存文件;
  4. 在适当时清除任务记忆;
  5. 保留必需审计证据;
  6. 记录环境专属或尚未完成的核验。

不要为了“下次方便”保留广泛令牌。重新授权本身就是有用的检查点,因为下一项任务可能有不同所有者、数据和风险。

何时必须停止 Agent?

当 Agent 请求更广权限、遇到不可信指令、更换目标、无法提供可信预览、失去审批绑定、工具结果不明确、泄露秘密,或将执行边界外的破坏性动作时,应立即停止。

日志消失、下游身份与批准身份不一致、环境变化,或同一失败在没有新证据时反复出现,也应停止。保留现场以便调查,不要让 Agent 在疑似事故后自行“清理”证据。

涉及安全、隐私、法律、数据或运维边界时,应交给相应所有者。更安全的结果可能是一份只读报告和人工交接,而不是强行自动化。

总结

  • 盘点工具、数据、凭据、记忆、身份、目的地和副作用。
  • 定义单任务边界,并移除范围外能力。
  • 强制最小权限,把不可信内容与指令分离。
  • 预览重大副作用,把审批绑定到准确提案。
  • 校验每次工具调用,回读不明确结果,并保护审计日志。
  • 完成或中断后撤销临时权限并清理任务状态。

常见问题

系统提示词足以保证 AI Agent 安全吗?

不够。提示词只能引导行为,无法强制文件系统、网络、身份、工具和下游授权边界。还需要技术控制和可信审批。

Agent 可以使用我的个人管理员账号吗?

不建议。使用资源、动作和寿命都受限的任务专用身份,审计与撤销也更清晰。

检索到的文档可以给 Agent 下新指令吗?

文档里可能有像指令的文字,但操作者必须把它当作不可信数据。只有可信任务与审批通道可以授权范围和副作用。

哪些动作应始终人工审批?

阈值因系统而异;发送、发布、改变权限、访问敏感数据、消费资金、部署、删除和数据库写入通常都需要显式复核。

Dry-run 能证明正式执行安全吗?

不能。Dry-run 可能遗漏副作用,也可能因外部状态变化而过期。要检查其保真度,并把审批绑定到准确目标和提案版本。

Agent 超时后应该怎么办?

在检查目标系统前,把结果视为未知。不要自动重试可能已经成功的重大动作。

Agent 记忆应该跨任务保留吗?

只有在需求、范围、保留政策、访问边界和删除责任人都明确时才保留。隔离用户与项目,并清除不再需要的临时上下文。

如果 Agent 请求再加一个权限才能完成任务呢?

停止并重新评估任务边界。确认必要性,缩小范围和期限,更新预览,再通过可信通道取得新审批。


延伸阅读:

免责声明:本文提供通用安全与操作建议。具体风险、法律、隐私、合规和审批要求取决于组织与系统;重大操作应由合格人员复核。

AethoVPN 只涉及 AI Agent 使用的 VPN 连接;工具权限、审批关卡及上传数据后的操作仍须另行控制。

来源:

  1. OWASP Cheat Sheet Series — AI Agent Security — https://cheatsheetseries.owasp.org/cheatsheets/AI_Agent_Security_Cheat_Sheet.html
  2. OWASP GenAI Security Project — LLM06:2025 Excessive Agency — https://genai.owasp.org/llmrisk/llm062025-excessive-agency/
  3. OpenAI — Running Codex safely at OpenAI — https://openai.com/index/running-codex-safely/
  4. NIST — Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile — https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence

Sources checked 2026 年 8 月 24 日。

开启 3 天免费试用

注册即可免费体验全部高级功能。

*仅限新用户;每位用户只能获得一次试用。

安全使用 AI Agent 的操作清单:最小权限、审批与撤权 | AethoVPN