开启 3 天免费试用
注册即可免费体验全部高级功能。
*仅限新用户;每位用户只能获得一次试用。


要安全使用 AI Agent,应当只授予一个明确任务所需的最少数据、工具与权限,把执行限制在隔离边界内,并在产生重大副作用前经过可信审批。检索到的文档、消息、网页、工具输出和历史记忆都应视为不可信输入;日志、撤权、清理和停止条件则必须掌握在可问责的人或服务所有者手中。
这是一份面向已有 Agent 的操作者指南。若要先理解控制循环,可阅读 AI Agent 是什么;当你准备让 Agent 执行真实任务时,再用本文划定操作边界。
关键要点
- 用输入、输出、排除项和停止点定义单任务授权边界。
- 启动前盘点工具、身份、凭据、数据、记忆和网络目的地。
- 按工具和资源实施最小权限,并分离读取与修改能力。
- 把外部内容当作数据,绝不能当作授权来源。
- 预览副作用,通过可信通道批准高影响动作,并保留审计证据。
- 任务结束或结果不明确时,先核验,再撤权、清理状态或停止。
把 Agent 看作一个需要监管的初级服务账号,而不是普通聊天对象。模型可以理解文字指令,但真正决定它能访问哪些文件、API、记录、命令和网络目的地的,必须是模型之外的技术控制。
OWASP 建议只提供最少工具、按工具限制权限、为不同信任级别分离工具集,并对敏感操作实施显式授权。[1] 这些是部署控制,不是只写在提示词里的愿望。
开始前建立操作记录:
| 字段 | 有边界的示例 |
|---|---|
| 目标 | 根据四份指定本地文档起草报告 |
| 输入 | 一个目录内的命名只读文件 |
| 输出 | 暂存目录中的一份草稿 |
| 禁止项 | 邮件、删除、发布、凭据访问、新网络目的地 |
| 完成条件 | 草稿存在、来源已映射、无未解决检索错误 |
| 停止条件 | 范围变化、不可信指令、权限请求、副作用不明确 |
如果这张表无法填清,任务还不适合交给 Agent 执行。
列出 Agent 的工具、连接器、插件、本地路径、网络目的地、服务账号、环境变量、记忆和审批通道。即使某项能力没有出现在任务里,只要已启用,也必须纳入盘点。
每一项都要记录:
OWASP 将过度代理能力归因于过多功能、过大权限或过高自主性。[2] 一个只需读邮件的任务,不应因为连接器把收发能力打包在一起而继承发送权限。
“不要删除任何东西”弱于根本不提供删除工具。移除任务不需要的能力。若平台无法拆分读写权限,应改用更受限的连接器、代理层、一次性环境或人工交接。
AI 隐私风险指南可以帮助你在数据进入上下文前完成分类。与其等数据已被日志、记忆或外部请求复制后再清理,不如事先最小化。
明确输入、允许的转换、输出位置、资源预算、截止时间和停止条件。避免“管理我的收件箱”“改进这个仓库”或“持续推进项目”这类开放目标,因为它们允许 Agent 自行发明子目标并扩大权限。
一个可靠边界应把提案和执行分开:
若你是在设计自动化本身,请参考 用 AI 自动化重复任务。本文假定流程已存在,只讨论如何安全操作。
不要复用个人账号或管理员身份,应创建任务专用权限。把访问限制到指定仓库、文件夹、邮箱、数据库视图、API 动作和目的地,并分离读取与修改。
优先使用短期、窄范围且可独立撤销的凭据。不要把秘密粘贴进提示词,也不要存入长期记忆;应通过平台的受保护机制提供,并确认日志和工具输出不会回显。
文件系统、网络和命令边界要分别设置。OpenAI 将沙箱描述为技术执行边界,将审批描述为跨越边界时的治理机制。[3] 两者互补,不能互相替代。
图中是操作者检查清单,不是某个平台已落实控制的证明。必须回读真实配置和下游身份。
邮件、工单、网页、仓库文件、文档、API 响应或另一个 Agent 都可能包含看起来像指令的文字。OWASP 要求把外部数据视为不可信,并与真正指令明确分离。[1]
遵守以下规则:
不要让同一个模型独自判断针对自己的提示注入是否无害。模糊场景应依靠确定性策略检查、受限工具和人工复核。
不要把不同用户、客户、项目或信任等级混入同一记忆范围。明确哪些内容可以保留、保留多久、谁能删除;政策允许时,在核验后清除任务临时上下文。
过期记忆中的旧指令可能与恶意新文档一样危险。任务边界不能覆盖当前授权或下游强制策略。
在能够真实代表动作时,使用只读检查、dry-run、草稿或 diff 模式。预览应显示准确目标、身份、资源集合、变更、接收方、权限和预期后果。
预览是证据,不是授权。它可能不完整,执行前外部状态也可能变化。审批必须绑定到准确提案版本、范围、目标、身份和有效期。
若要设计严谨的门禁,请参考 带人工审批的 AI 工作流。如果不可信内容可以伪造“批准”,或执行器能够绕过按钮,那么按钮本身没有意义。
运行前就设定审批阈值。发送消息、发布内容、修改源码、变更权限、安装软件、访问敏感记录、执行数据库写入、花费资金、部署或删除数据,通常都需要显式复核。
审批者需要一份证据包:
只要提案、目标、身份、数据或工具参数改变,就应拒绝或使旧审批过期。绝不能让 Agent 自己批准权限扩张。
每一次工具调用都必须由中介层实施资源和参数规则。使用结构化 schema、allowlist、大小限制、timeout、速率限制,并在重试可能重复副作用时提供幂等键或回读核验。
执行 Agent 生成的脚本或命令前,应用 AI 生成代码复核清单,检查依赖、Shell 插值、查询构造、路径、网络访问、清理和错误处理。
超时或断连属于“结果未知”,而不一定是失败。重试重大动作前先检查目标系统;如果第一次其实成功,盲目重放可能重复邮件、扣款、工单或部署。
记录任务 ID、操作者、Agent 和工具版本、策略版本、批准输入、提案身份、审批事件、工具名称、经脱敏的参数证据、结果状态、时间戳和回读结论。删除令牌、个人数据、私密内容和秘密查询参数。
日志应位于 Agent 无法单方面修改的位置。对意外工具或目的地、权限失败、重复重试、异常大输出、策略绕过,以及任务完成后的活动发出告警。
NIST 生成式 AI Profile 用于把可信性考量纳入生成式 AI 的设计、开发、使用和评估。[4] 对操作者而言,既要评估输出,也要评估产生输出的控制环境。
执行后,独立查询目标系统或检查最终资源,确认预期副作用只发生一次、目标正确,并且没有额外资源被改变。
随后:
不要为了“下次方便”保留广泛令牌。重新授权本身就是有用的检查点,因为下一项任务可能有不同所有者、数据和风险。
当 Agent 请求更广权限、遇到不可信指令、更换目标、无法提供可信预览、失去审批绑定、工具结果不明确、泄露秘密,或将执行边界外的破坏性动作时,应立即停止。
日志消失、下游身份与批准身份不一致、环境变化,或同一失败在没有新证据时反复出现,也应停止。保留现场以便调查,不要让 Agent 在疑似事故后自行“清理”证据。
涉及安全、隐私、法律、数据或运维边界时,应交给相应所有者。更安全的结果可能是一份只读报告和人工交接,而不是强行自动化。
不够。提示词只能引导行为,无法强制文件系统、网络、身份、工具和下游授权边界。还需要技术控制和可信审批。
不建议。使用资源、动作和寿命都受限的任务专用身份,审计与撤销也更清晰。
文档里可能有像指令的文字,但操作者必须把它当作不可信数据。只有可信任务与审批通道可以授权范围和副作用。
阈值因系统而异;发送、发布、改变权限、访问敏感数据、消费资金、部署、删除和数据库写入通常都需要显式复核。
不能。Dry-run 可能遗漏副作用,也可能因外部状态变化而过期。要检查其保真度,并把审批绑定到准确目标和提案版本。
在检查目标系统前,把结果视为未知。不要自动重试可能已经成功的重大动作。
只有在需求、范围、保留政策、访问边界和删除责任人都明确时才保留。隔离用户与项目,并清除不再需要的临时上下文。
停止并重新评估任务边界。确认必要性,缩小范围和期限,更新预览,再通过可信通道取得新审批。
延伸阅读:
免责声明:本文提供通用安全与操作建议。具体风险、法律、隐私、合规和审批要求取决于组织与系统;重大操作应由合格人员复核。
AethoVPN 只涉及 AI Agent 使用的 VPN 连接;工具权限、审批关卡及上传数据后的操作仍须另行控制。
来源:
Sources checked 2026 年 8 月 24 日。
注册即可免费体验全部高级功能。
*仅限新用户;每位用户只能获得一次试用。