開啟 3 天免費試用
註冊即可免費體驗全部高級功能。
*只限新用戶;每位用戶只可獲得一次試用。


要安全使用 AI Agent,應當只授予一個明確任務所需的最少資料、工具與權限,把執行限制在隔離邊界內,並在產生重大副作用前經過可信審批。檢索到的文件、訊息、網頁、工具輸出和歷史記憶都應視為不可信輸入;日誌、撤權、清理和停止條件則必須掌握在可問責的人或服務擁有者手中。
這是一份面向既有 Agent 的操作者指南。若要先理解控制迴圈,可閱讀 AI Agent 是甚麼;當你準備讓 Agent 執行真實任務時,再用本文劃定操作邊界。
關鍵要點
- 用輸入、輸出、排除項和停止點定義單一任務授權邊界。
- 啟動前盤點工具、身份、憑證、資料、記憶和網絡目的地。
- 按工具和資源實施最小權限,並分離讀取與修改能力。
- 把外部內容當作資料,絕不能當作授權來源。
- 預覽副作用,透過可信通道批准高影響動作,並保留稽核證據。
- 任務結束或結果不明確時,先核驗,再撤權、清理狀態或停止。
把 Agent 看作一個需要監管的初級服務帳號,而不是普通聊天對象。模型可以理解文字指令,但真正決定它能存取哪些檔案、API、記錄、命令和網絡目的地的,必須是模型之外的技術控制。
OWASP 建議只提供最少工具、按工具限制權限、為不同信任級別分離工具集,並對敏感操作實施明確授權。[1] 這些是部署控制,不是只寫在提示詞裏的願望。
開始前建立操作記錄:
| 欄位 | 有邊界的範例 |
|---|---|
| 目標 | 根據四份指定本機文件起草報告 |
| 輸入 | 一個目錄內的命名唯讀檔案 |
| 輸出 | 暫存目錄中的一份草稿 |
| 禁止項 | 郵件、刪除、發布、憑證存取、新網絡目的地 |
| 完成條件 | 草稿存在、來源已映射、無未解決檢索錯誤 |
| 停止條件 | 範圍變化、不可信指令、權限請求、副作用不明確 |
如果這張表無法填清,任務還不適合交給 Agent 執行。
列出 Agent 的工具、連接器、外掛程式、本機路徑、網絡目的地、服務帳號、環境變數、記憶和審批通道。即使某項能力沒有出現在任務裏,只要已啟用,也必須納入盤點。
每一項都要記錄:
OWASP 將過度代理能力歸因於過多功能、過大權限或過高自主性。[2] 一個只需讀郵件的任務,不應因為連接器把收發能力綁在一起而繼承傳送權限。
「不要刪除任何東西」弱於根本不提供刪除工具。移除任務不需要的能力。若平台無法拆分讀寫權限,應改用更受限的連接器、代理層、一次性環境或人工交接。
AI 私隱風險指南可以幫助你在資料進入上下文前完成分類。與其等資料已被日誌、記憶或外部請求複製後再清理,不如事先最小化。
明確輸入、允許的轉換、輸出位置、資源預算、截止時間和停止條件。避免「管理我的收件匣」「改善這個儲存庫」或「持續推進項目」這類開放目標,因為它們允許 Agent 自行發明子目標並擴大權限。
一個可靠邊界應把提案和執行分開:
若你是在設計自動化本身,請參考 用 AI 自動化重複任務。本文假定流程已存在,只討論如何安全操作。
不要重用個人帳號或管理員身份,應建立任務專用權限。把存取限制到指定儲存庫、資料夾、信箱、資料庫檢視表、API 動作和目的地,並分離讀取與修改。
優先使用短期、窄範圍且可獨立撤銷的憑證。不要把秘密貼進提示詞,也不要存入長期記憶;應透過平台的受保護機制提供,並確認日誌和工具輸出不會回顯。
檔案系統、網絡和命令邊界要分別設定。OpenAI 將沙箱描述為技術執行邊界,將審批描述為跨越邊界時的治理機制。[3] 兩者互補,不能互相取代。
圖中是操作者檢查清單,不是某個平台已落實控制的證明。必須回讀真實設定和下游身份。
郵件、工單、網頁、儲存庫檔案、文件、API 回應或另一個 Agent 都可能包含看起來像指令的文字。OWASP 要求把外部資料視為不可信,並與真正指令明確分離。[1]
遵守以下規則:
不要讓同一個模型獨自判斷針對自己的提示注入是否無害。模糊場景應依靠確定性策略檢查、受限工具和人工複核。
不要把不同用戶、客戶、項目或信任等級混入同一記憶範圍。明確哪些內容可以保留、保留多久、誰能刪除;政策允許時,在核驗後清除任務臨時上下文。
過期記憶中的舊指令可能與惡意新文件一樣危險。任務邊界不能覆蓋目前授權或下游強制策略。
在能夠真實代表動作時,使用唯讀檢查、dry-run、草稿或 diff 模式。預覽應顯示準確目標、身份、資源集合、變更、接收方、權限和預期後果。
預覽是證據,不是授權。它可能不完整,執行前外部狀態也可能變化。審批必須綁定到準確提案版本、範圍、目標、身份和有效期。
若要設計嚴謹的門禁,請參考 帶人工審批的 AI 工作流程。如果不可信內容可以偽造「批准」,或執行器能夠繞過按鈕,那麼按鈕本身沒有意義。
執行前就設定審批門檻。傳送訊息、發布內容、修改原始碼、變更權限、安裝軟件、存取敏感記錄、執行資料庫寫入、花費資金、部署或刪除資料,通常都需要明確複核。
審批者需要一份證據包:
只要提案、目標、身份、資料或工具參數改變,就應拒絕或使舊審批過期。絕不能讓 Agent 自己批准權限擴張。
每一次工具呼叫都必須由中介層實施資源和參數規則。使用結構化 schema、allowlist、大小限制、timeout、速率限制,並在重試可能重複副作用時提供冪等鍵或回讀核驗。
執行 Agent 產生的腳本或命令前,套用 AI 產生程式碼複核清單,檢查依賴、Shell 插值、查詢建構、路徑、網絡存取、清理和錯誤處理。
逾時或斷線屬於「結果未知」,而不一定是失敗。重試重大動作前先檢查目標系統;如果第一次其實成功,盲目重播可能重複郵件、扣款、工單或部署。
記錄任務 ID、操作者、Agent 和工具版本、策略版本、批准輸入、提案身份、審批事件、工具名稱、經去識別化的參數證據、結果狀態、時間戳和回讀結論。刪除權杖、個人資料、私密內容和秘密查詢參數。
日誌應位於 Agent 無法單方面修改的位置。對意外工具或目的地、權限失敗、重複重試、異常大輸出、策略繞過,以及任務完成後的活動發出警示。
NIST 生成式 AI Profile 用於把可信性考量納入生成式 AI 的設計、開發、使用和評估。[4] 對操作者而言,既要評估輸出,也要評估產生輸出的控制環境。
執行後,獨立查詢目標系統或檢查最終資源,確認預期副作用只發生一次、目標正確,並且沒有額外資源被改變。
隨後:
不要為了「下次方便」保留廣泛權杖。重新授權本身就是有用的檢查點,因為下一項任務可能有不同擁有者、資料和風險。
當 Agent 請求更廣權限、遇到不可信指令、更換目標、無法提供可信預覽、失去審批綁定、工具結果不明確、洩漏秘密,或將執行邊界外的破壞性動作時,應立即停止。
日誌消失、下游身份與批准身份不一致、環境變化,或同一失敗在沒有新證據時反覆出現,也應停止。保留現場以便調查,不要讓 Agent 在疑似事故後自行「清理」證據。 AethoVPN 只涉及 AI 智能代理使用的 VPN 連線;工具權限、審批關卡及上載資料後的操作仍須另行控制。
涉及安全、私隱、法律、資料或維運邊界時,應交給相應擁有者。更安全的結果可能是一份唯讀報告和人工交接,而不是強行自動化。
不夠。提示詞只能引導行為,無法強制檔案系統、網絡、身份、工具和下游授權邊界。還需要技術控制和可信審批。
不建議。使用資源、動作和壽命都受限的任務專用身份,稽核與撤銷也更清楚。
文件裏可能有像指令的文字,但操作者必須把它當作不可信資料。只有可信任務與審批通道可以授權範圍和副作用。
門檻因系統而異;傳送、發布、改變權限、存取敏感資料、消費資金、部署、刪除和資料庫寫入通常都需要明確複核。
不能。Dry-run 可能遺漏副作用,也可能因外部狀態變化而過期。要檢查其保真度,並把審批綁定到準確目標和提案版本。
在檢查目標系統前,把結果視為未知。不要自動重試可能已經成功的重大動作。
只有在需求、範圍、保留政策、存取邊界和刪除責任人都明確時才保留。隔離用戶與項目,並清除不再需要的臨時上下文。
停止並重新評估任務邊界。確認必要性,縮小範圍和期限,更新預覽,再透過可信通道取得新審批。
延伸閱讀:
免責聲明:本文提供通用安全與操作建議。具體風險、法律、私隱、法遵和審批要求取決於組織與系統;重大操作應由合格人員複核。
來源:
Sources checked 2026 年 8 月 24 日。
註冊即可免費體驗全部高級功能。
*只限新用戶;每位用戶只可獲得一次試用。