安全使用 AI Agent 的操作清單:最小權限、審批與撤權

安全使用 AI Agent 的操作清單:最小權限、審批與撤權

Olivia Park
2026年8月24日· 9 分鐘讀完

要安全使用 AI Agent,應當只授予一個明確任務所需的最少資料、工具與權限,把執行限制在隔離邊界內,並在產生重大副作用前經過可信審批。檢索到的文件、訊息、網頁、工具輸出和歷史記憶都應視為不可信輸入;日誌、撤權、清理和停止條件則必須掌握在可問責的人或服務擁有者手中。

這是一份面向既有 Agent 的操作者指南。若要先理解控制迴圈,可閱讀 AI Agent 是甚麼;當你準備讓 Agent 執行真實任務時,再用本文劃定操作邊界。

關鍵要點

  • 用輸入、輸出、排除項和停止點定義單一任務授權邊界。
  • 啟動前盤點工具、身份、憑證、資料、記憶和網絡目的地。
  • 按工具和資源實施最小權限,並分離讀取與修改能力。
  • 把外部內容當作資料,絕不能當作授權來源。
  • 預覽副作用,透過可信通道批准高影響動作,並保留稽核證據。
  • 任務結束或結果不明確時,先核驗,再撤權、清理狀態或停止。

操作者如何安全使用 AI Agent?

把 Agent 看作一個需要監管的初級服務帳號,而不是普通聊天對象。模型可以理解文字指令,但真正決定它能存取哪些檔案、API、記錄、命令和網絡目的地的,必須是模型之外的技術控制。

OWASP 建議只提供最少工具、按工具限制權限、為不同信任級別分離工具集,並對敏感操作實施明確授權。[1] 這些是部署控制,不是只寫在提示詞裏的願望。

開始前建立操作記錄:

欄位有邊界的範例
目標根據四份指定本機文件起草報告
輸入一個目錄內的命名唯讀檔案
輸出暫存目錄中的一份草稿
禁止項郵件、刪除、發布、憑證存取、新網絡目的地
完成條件草稿存在、來源已映射、無未解決檢索錯誤
停止條件範圍變化、不可信指令、權限請求、副作用不明確

如果這張表無法填清,任務還不適合交給 Agent 執行。

第 1 步:盤點所有能力與信任邊界

列出 Agent 的工具、連接器、外掛程式、本機路徑、網絡目的地、服務帳號、環境變數、記憶和審批通道。即使某項能力沒有出現在任務裏,只要已啟用,也必須納入盤點。

每一項都要記錄:

  • 可讀取、寫入、刪除、執行、傳送、發布或管理哪些內容;
  • 資源範圍是一份檔案還是整個雲端硬碟;
  • 下游實際使用哪個身份;
  • 憑證壽命以及誰負責撤銷;
  • 資料分類和保留期限;
  • 可能產生的外部副作用;
  • 操作者可以回讀哪些日誌。

OWASP 將過度代理能力歸因於過多功能、過大權限或過高自主性。[2] 一個只需讀郵件的任務,不應因為連接器把收發能力綁在一起而繼承傳送權限。

不要只靠「禁止」指令

「不要刪除任何東西」弱於根本不提供刪除工具。移除任務不需要的能力。若平台無法拆分讀寫權限,應改用更受限的連接器、代理層、一次性環境或人工交接。

AI 私隱風險指南可以幫助你在資料進入上下文前完成分類。與其等資料已被日誌、記憶或外部請求複製後再清理,不如事先最小化。

第 2 步:寫清單一任務授權邊界

明確輸入、允許的轉換、輸出位置、資源預算、截止時間和停止條件。避免「管理我的收件匣」「改善這個儲存庫」或「持續推進項目」這類開放目標,因為它們允許 Agent 自行發明子目標並擴大權限。

一個可靠邊界應把提案和執行分開:

  1. 只檢查命名資源;
  2. 產生計畫和預期副作用預覽;
  3. 影響超過預設門檻時停止並請求審批;
  4. 只執行被批准的準確版本;
  5. 回讀結果並停止。

若你是在設計自動化本身,請參考 用 AI 自動化重複任務。本文假定流程已存在,只討論如何安全操作。

第 3 步:按工具、資源和時間授予最小權限

不要重用個人帳號或管理員身份,應建立任務專用權限。把存取限制到指定儲存庫、資料夾、信箱、資料庫檢視表、API 動作和目的地,並分離讀取與修改。

優先使用短期、窄範圍且可獨立撤銷的憑證。不要把秘密貼進提示詞,也不要存入長期記憶;應透過平台的受保護機制提供,並確認日誌和工具輸出不會回顯。

檔案系統、網絡和命令邊界要分別設定。OpenAI 將沙箱描述為技術執行邊界,將審批描述為跨越邊界時的治理機制。[3] 兩者互補,不能互相取代。

圖中是操作者檢查清單,不是某個平台已落實控制的證明。必須回讀真實設定和下游身份。

第 4 步:把檢索內容和工具輸出視為不可信

郵件、工單、網頁、儲存庫檔案、文件、API 回應或另一個 Agent 都可能包含看起來像指令的文字。OWASP 要求把外部資料視為不可信,並與真正指令明確分離。[1]

遵守以下規則:

  • 指令只能來自可信任務邊界和審批通道;
  • 檢索內容需要定界並標記為資料;
  • 內容不能授予工具、改變範圍、索取憑證或批准動作;
  • 工具參數在模型之外經過 schema 與 allowlist 校驗;
  • URL、路徑、收件者、分支、帳戶 ID 和金額在執行時重新驗證;
  • 可疑內容觸發停止或隔離,而不是臨時繞過。

不要讓同一個模型獨自判斷針對自己的提示注入是否無害。模糊場景應依靠確定性策略檢查、受限工具和人工複核。

隔離記憶與上下文

不要把不同用戶、客戶、項目或信任等級混入同一記憶範圍。明確哪些內容可以保留、保留多久、誰能刪除;政策允許時,在核驗後清除任務臨時上下文。

過期記憶中的舊指令可能與惡意新文件一樣危險。任務邊界不能覆蓋目前授權或下游強制策略。

第 5 步:預覽每一個重大副作用

在能夠真實代表動作時,使用唯讀檢查、dry-run、草稿或 diff 模式。預覽應顯示準確目標、身份、資源集合、變更、接收方、權限和預期後果。

預覽是證據,不是授權。它可能不完整,執行前外部狀態也可能變化。審批必須綁定到準確提案版本、範圍、目標、身份和有效期。

若要設計嚴謹的門禁,請參考 帶人工審批的 AI 工作流程。如果不可信內容可以偽造「批准」,或執行器能夠繞過按鈕,那麼按鈕本身沒有意義。

第 6 步:高影響動作必須經過可信審批

執行前就設定審批門檻。傳送訊息、發布內容、修改原始碼、變更權限、安裝軟件、存取敏感記錄、執行資料庫寫入、花費資金、部署或刪除資料,通常都需要明確複核。

審批者需要一份證據包:

  • 任務和業務擁有者;
  • 準確的提案及其不可變版本;
  • 受影響的資源和接收方;
  • 權限和執行身份;
  • 已完成的驗證;
  • 預期影響和失敗模式;
  • 回復或復原路徑;
  • 未知項目和環境缺口。

只要提案、目標、身份、資料或工具參數改變,就應拒絕或使舊審批過期。絕不能讓 Agent 自己批准權限擴張。

第 7 步:透過受限工具執行並驗證輸出

每一次工具呼叫都必須由中介層實施資源和參數規則。使用結構化 schema、allowlist、大小限制、timeout、速率限制,並在重試可能重複副作用時提供冪等鍵或回讀核驗。

執行 Agent 產生的腳本或命令前,套用 AI 產生程式碼複核清單,檢查依賴、Shell 插值、查詢建構、路徑、網絡存取、清理和錯誤處理。

逾時或斷線屬於「結果未知」,而不一定是失敗。重試重大動作前先檢查目標系統;如果第一次其實成功,盲目重播可能重複郵件、扣款、工單或部署。

第 8 步:記錄足夠證據,但不記錄秘密

記錄任務 ID、操作者、Agent 和工具版本、策略版本、批准輸入、提案身份、審批事件、工具名稱、經去識別化的參數證據、結果狀態、時間戳和回讀結論。刪除權杖、個人資料、私密內容和秘密查詢參數。

日誌應位於 Agent 無法單方面修改的位置。對意外工具或目的地、權限失敗、重複重試、異常大輸出、策略繞過,以及任務完成後的活動發出警示。

NIST 生成式 AI Profile 用於把可信性考量納入生成式 AI 的設計、開發、使用和評估。[4] 對操作者而言,既要評估輸出,也要評估產生輸出的控制環境。

第 9 步:回讀、撤權並清理任務狀態

執行後,獨立查詢目標系統或檢查最終資源,確認預期副作用只發生一次、目標正確,並且沒有額外資源被改變。

隨後:

  1. 撤銷或讓任務憑證過期;
  2. 關閉臨時連接器和網絡規則;
  3. 按保留政策處理暫存檔案;
  4. 在適當時清除任務記憶;
  5. 保留必要稽核證據;
  6. 記錄環境專屬或尚未完成的核驗。

不要為了「下次方便」保留廣泛權杖。重新授權本身就是有用的檢查點,因為下一項任務可能有不同擁有者、資料和風險。

何時必須停止 Agent?

當 Agent 請求更廣權限、遇到不可信指令、更換目標、無法提供可信預覽、失去審批綁定、工具結果不明確、洩漏秘密,或將執行邊界外的破壞性動作時,應立即停止。

日誌消失、下游身份與批准身份不一致、環境變化,或同一失敗在沒有新證據時反覆出現,也應停止。保留現場以便調查,不要讓 Agent 在疑似事故後自行「清理」證據。 AethoVPN 只涉及 AI 智能代理使用的 VPN 連線;工具權限、審批關卡及上載資料後的操作仍須另行控制。

涉及安全、私隱、法律、資料或維運邊界時,應交給相應擁有者。更安全的結果可能是一份唯讀報告和人工交接,而不是強行自動化。

總結

  • 盤點工具、資料、憑證、記憶、身份、目的地和副作用。
  • 定義單一任務邊界,並移除範圍外能力。
  • 強制最小權限,把不可信內容與指令分離。
  • 預覽重大副作用,把審批綁定到準確提案。
  • 校驗每次工具呼叫,回讀不明確結果,並保護稽核日誌。
  • 完成或中斷後撤銷臨時權限並清理任務狀態。

常見問題

系統提示詞足以保證 AI Agent 安全嗎?

不夠。提示詞只能引導行為,無法強制檔案系統、網絡、身份、工具和下游授權邊界。還需要技術控制和可信審批。

Agent 可以使用我的個人管理員帳號嗎?

不建議。使用資源、動作和壽命都受限的任務專用身份,稽核與撤銷也更清楚。

檢索到的文件可以給 Agent 下新指令嗎?

文件裏可能有像指令的文字,但操作者必須把它當作不可信資料。只有可信任務與審批通道可以授權範圍和副作用。

哪些動作應始終人工審批?

門檻因系統而異;傳送、發布、改變權限、存取敏感資料、消費資金、部署、刪除和資料庫寫入通常都需要明確複核。

Dry-run 能證明正式執行安全嗎?

不能。Dry-run 可能遺漏副作用,也可能因外部狀態變化而過期。要檢查其保真度,並把審批綁定到準確目標和提案版本。

Agent 逾時後應該怎麼辦?

在檢查目標系統前,把結果視為未知。不要自動重試可能已經成功的重大動作。

Agent 記憶應該跨任務保留嗎?

只有在需求、範圍、保留政策、存取邊界和刪除責任人都明確時才保留。隔離用戶與項目,並清除不再需要的臨時上下文。

如果 Agent 請求再加一個權限才能完成任務呢?

停止並重新評估任務邊界。確認必要性,縮小範圍和期限,更新預覽,再透過可信通道取得新審批。


延伸閱讀:

免責聲明:本文提供通用安全與操作建議。具體風險、法律、私隱、法遵和審批要求取決於組織與系統;重大操作應由合格人員複核。

來源:

  1. OWASP Cheat Sheet Series — AI Agent Security — https://cheatsheetseries.owasp.org/cheatsheets/AI_Agent_Security_Cheat_Sheet.html
  2. OWASP GenAI Security Project — LLM06:2025 Excessive Agency — https://genai.owasp.org/llmrisk/llm062025-excessive-agency/
  3. OpenAI — Running Codex safely at OpenAI — https://openai.com/index/running-codex-safely/
  4. NIST — Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile — https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence

Sources checked 2026 年 8 月 24 日。

開啟 3 天免費試用

註冊即可免費體驗全部高級功能。

*只限新用戶;每位用戶只可獲得一次試用。

安全使用 AI Agent 的操作清單:最小權限、審批與撤權 | AethoVPN