Как безопасно использовать ИИ-агентов: права и одобрение

Как безопасно использовать ИИ-агентов: права и одобрение

Olivia Park
24 августа 2026 г.· 11 мин чтения

Чтобы безопасно использовать ИИ-агентов, выдавайте каждому одну точную задачу, минимум нужных данных и инструментов, изолированную среду выполнения и доверенный шлюз одобрения перед значимыми действиями. Считайте полученные документы, сообщения, веб-страницы, результаты инструментов и сохранённый контекст недоверенными; журналы, отзыв доступа, очистка и условия остановки должны оставаться у ответственного человека или владельца сервиса.

Это руководство для оператора уже существующего агента. Если сначала нужно понять цикл управления, прочитайте что такое ИИ-агент, а затем вернитесь сюда, чтобы не передать реальной задаче открытую власть.

Ключевые выводы

  • Опишите одну задачу через точные входы, выходы, исключения и точку остановки.
  • До запуска инвентаризируйте инструменты, личности, реквизиты, данные, память и сетевые назначения.
  • Выдавайте минимальные права по инструменту и ресурсу, разделяя чтение и изменение.
  • Внешнее содержимое — это данные, а не доверенная авторизация.
  • Предварительно показывайте эффекты, одобряйте опасные действия через доверенный канал и сохраняйте аудит.
  • После выполнения или неясного исхода сначала сверяйте состояние, затем отзывайте доступ и очищайте временный контекст.

Как оператору безопасно использовать ИИ-агентов?

Относитесь к агенту как к младшей служебной учётной записи под контролем, а не как к собеседнику. Модель может рассуждать об инструкциях, но доступные ей файлы, API, записи, команды и сетевые назначения должны определяться техническими средствами вне модели.

OWASP рекомендует минимальный набор инструментов, ограничение разрешений для каждого инструмента, разделение наборов по уровню доверия и явную авторизацию чувствительных операций.[1] Это средства принудительного контроля, а не пожелания в системном промпте.

Составьте запись оператора:

ПолеПример с чёткой границей
ЦельПодготовить отчёт по четырём утверждённым локальным документам
ВходыНазванные файлы только для чтения в одном каталоге
ВыходОдин черновик в промежуточном каталоге
ЗапрещеноПочта, удаление, публикация, доступ к секретам, новые сетевые адреса
ЗавершениеЧерновик создан, источники сопоставлены, ошибок чтения нет
ОстановкаИзменение области, недоверенная инструкция, запрос прав, неясный эффект

Если таблицу нельзя заполнить однозначно, задача ещё не готова к выполнению агентом.

Шаг 1. Инвентаризируйте возможности и границы доверия

Перечислите инструменты, коннекторы, плагины, локальные пути, сетевые назначения, служебные аккаунты, переменные окружения, память и каналы одобрения. Учтите включённые возможности, даже если задача их не упоминает.

Для каждого элемента зафиксируйте:

  • возможность читать, писать, удалять, выполнять, отправлять, публиковать или администрировать;
  • область ресурса: один файл или весь диск;
  • учётную запись, от имени которой фактически действуют нижестоящие системы;
  • срок реквизитов и владельца отзыва;
  • класс и срок хранения данных;
  • внешние побочные эффекты;
  • доступные оператору журналы.

OWASP описывает чрезмерную агентность (excessive agency) как избыток функциональности, разрешений или автономии.[2] Задача чтения почты не должна получать возможность отправки только потому, что коннектор объединяет их.

Удаляйте лишние инструменты, а не только запрещайте их словами

Инструкция «ничего не удаляй» слабее отсутствующего инструмента удаления. Отключите всё, что не требуется задаче. Если платформа не разделяет чтение и запись, используйте ограниченный прокси, другой коннектор, одноразовую среду или передачу действия человеку.

Руководство по рискам приватности ИИ поможет классифицировать данные до попадания в контекст. Минимизировать ввод легче, чем удалять копии из журналов, памяти и внешних запросов.

Шаг 2. Задайте границы одной задачи

Определите входы, разрешённые преобразования, место результата, бюджет, срок и условия остановки. Избегайте целей вроде «управляй моей почтой», «улучшай репозиторий» или «двигай проект вперёд»: они позволяют агенту придумывать подцели и расширять власть.

Полезная граница отделяет предложение от выполнения:

  1. Проверить только названные ресурсы.
  2. Подготовить план и точный предварительный просмотр эффектов.
  3. Остановиться для одобрения при превышении заданного порога.
  4. Выполнить только утверждённую версию.
  5. Сверить результат и завершить работу.

Если вы проектируете саму автоматизацию, используйте отдельное руководство по повторяемым задачам. Здесь предполагается, что процесс уже существует, а задача — безопасно им управлять.

Шаг 3. Выдайте минимум прав по инструменту, ресурсу и времени

Создавайте разрешения для конкретной задачи, а не применяйте личную или административную учётную запись. Ограничьте доступ названными репозиториями, каталогами, почтовыми ящиками, представлениями базы, действиями API и адресами. Разделяйте чтение и изменение.

Используйте короткоживущие узкие токены, которые можно отозвать независимо. Не вставляйте секреты в промпт и не сохраняйте их в долговременной памяти. Передавайте их через защищённый механизм платформы и убедитесь, что журнал и вывод инструмента их не повторяют.

Файловые, сетевые и командные границы задаются отдельно. OpenAI описывает песочницу как техническую границу выполнения, а одобрения — как механизм контроля действий за её пределами.[3] Эти слои дополняют, но не заменяют друг друга.

Диаграмма — проверочный список, а не доказательство возможностей конкретной платформы. Проверьте реальную конфигурацию и учётную запись в нижестоящих системах.

Шаг 4. Считайте полученное содержимое и вывод инструментов недоверенными

Письмо, тикет, веб-страница, файл репозитория, документ, ответ API или другой агент могут содержать текст, похожий на инструкцию. OWASP требует считать внешние данные недоверенными и явно отделять их от инструкций.[1]

Соблюдайте правила:

  • инструкции исходят только из доверенного описания задачи и канала одобрения;
  • полученное содержимое ограничено и помечено как данные;
  • данные не могут выдать инструмент, изменить область, раскрыть секрет или одобрить действие;
  • аргументы инструмента проверяются по схеме и списку разрешённых значений вне модели;
  • URL, пути, получатели, ветки, ID аккаунтов и суммы повторно проверяются при выполнении;
  • подозрительное содержимое вызывает остановку или карантин, а не импровизированный обход.

Не поручайте атакованной модели самой решить, безвредно ли внедрённое в промпт указание (prompt injection). В неоднозначных случаях нужны детерминированная политика, ограниченные инструменты и человек.

Изолируйте память и контекст

Не объединяйте разных пользователей, клиентов, проекты и уровни доверия в одной области памяти. Определите, что хранится, как долго и кто может удалить данные. Когда политика разрешает, очищайте временный контекст после сверки.

Устаревшая инструкция из памяти может быть столь же опасна, как новый вредоносный документ. Описание задачи не отменяет текущую авторизацию и обязательные правила нижестоящих систем.

Шаг 5. Предварительно показывайте каждый значимый эффект

Используйте чтение, пробный прогон (dry-run), черновик или diff там, где режим честно отражает действие. Предварительный просмотр должен показывать точную цель, личность, набор ресурсов, изменение, получателей, разрешения и ожидаемые последствия.

Предварительный просмотр — доказательство для решения, но не само одобрение. Он может быть неполным, а внешнее состояние меняется до исполнения. Связывайте одобрение с точной версией предложения, областью, целью, личностью и сроком.

Для строгой конструкции применяйте процесс с человеческим одобрением. Кнопка «одобрить» бесполезна, если недоверенный текст способен её подделать или исполнитель может обойти шлюз.

Шаг 6. Требуйте доверенного одобрения опасных действий

Установите пороги до запуска. Отправка сообщений, публикация, изменение кода или разрешений, установка ПО, доступ к чувствительным данным, запись в базу, расходы, развёртывание и удаление обычно требуют явного решения человека.

Одобряющему нужен пакет доказательств: задача и владелец, точная неизменяемая версия предложения, затронутые ресурсы и получатели, личность и права, завершённые проверки, ожидаемые эффекты и отказы, восстановление, неизвестные и пробелы среды.

Изменение предложения, цели, личности, данных или аргументов делает старое одобрение недействительным. Агент не должен утверждать собственное расширение полномочий.

Шаг 7. Выполняйте через ограниченные инструменты и проверяйте результат

Посредник должен обеспечивать правила ресурсов и аргументов при каждом вызове. Применяйте структурированные схемы, списки разрешённых значений, лимиты размера и времени, ограничения частоты запросов, а при риске повторных эффектов — идемпотентность или обязательную сверку.

Перед запуском созданного агентом скрипта или команды примените чек-лист ревью созданного ИИ кода. Проверьте зависимости, подстановку в команды оболочки, запросы, пути, сеть, очистку и обработку ошибок.

Тайм-аут или разрыв связи означает неизвестный исход, а не гарантированный отказ. Перед повтором значимого действия прочитайте состояние цели. Незамеченный успех и повтор могут продублировать письмо, платёж, тикет или развёртывание.

Шаг 8. Ведите доказательный журнал без секретов

Записывайте ID задачи, оператора, версии агента, инструментов и политики, разрешённые входы, идентификатор предложения, событие одобрения, инструмент, безопасное представление аргументов, статус, время и итог сверки. Редактируйте токены, персональные данные, закрытый контент и секретные параметры.

Журнал должен находиться вне одностороннего контроля агента и быть защищён от незаметного изменения. Настройте сигналы на неожиданные инструменты и назначения, отказы прав, повторы, большой вывод, попытки обойти политику и активность после завершения.

NIST Generative AI Profile помогает включать требования доверия в проектирование, разработку, применение и оценку генеративного ИИ.[4] Оператору следует оценивать и результат, и систему контроля, которая его создала.

Шаг 9. Сверьте, отзовите доступ и очистите состояние задачи

После выполнения независимо запросите целевую систему или проверьте итоговый ресурс. Убедитесь, что ожидаемый эффект произошёл один раз, применён к правильной цели и не затронул лишнее.

Затем:

  1. отзовите или дождитесь истечения реквизитов задачи;
  2. отключите временные коннекторы и сетевые правила;
  3. удалите или сохраните промежуточные файлы по политике;
  4. при необходимости очистите память задачи;
  5. сохраните обязательные доказательства аудита;
  6. зафиксируйте неразрешённые и платформенные проверки.

Не оставляйте широкий токен «на следующий раз». Повторная авторизация — полезная контрольная точка: у следующей задачи могут быть другие владелец, данные и риск.

Когда оператор обязан остановить агента?

Немедленно остановитесь, если агент просит более широкий доступ, встречает недоверенную инструкцию, меняет цель, не может показать достоверный предварительный просмотр, теряет привязку одобрения, получает неоднозначный результат, раскрывает секрет или подходит к неразрешённому разрушительному действию.

Исчезновение журналов, несовпадение учётной записи в нижестоящих системах с одобренной, смена среды и повтор одной ошибки без новых доказательств — тоже причины остановки. Сохраните состояние для расследования и не позволяйте агенту «очистить» следы возможного инцидента.

Передайте вопрос владельцам безопасности, приватности, права, данных или эксплуатации, если затронуты их границы. Иногда безопасный результат — отчёт только для чтения и ручная передача, а не принудительная автоматизация.

Итоги

  • Инвентаризируйте инструменты, данные, реквизиты, память, личности, назначения и эффекты.
  • Опишите одну задачу и удалите возможности за её пределами.
  • Обеспечьте минимальные права и отделите недоверенные данные от инструкций.
  • Предварительно показывайте эффекты и связывайте одобрение с точным предложением.
  • Проверяйте каждый вызов, сверяйте неизвестные исходы и защищайте журнал.
  • После завершения или остановки отзывайте временный доступ и очищайте состояние.

Часто задаваемые вопросы (FAQ)

Обеспечивает ли системный промпт безопасность ИИ-агента?

Нет. Промпт направляет поведение, но не обеспечивает границы файловой системы, сети, учётных записей, инструментов и авторизации в нижестоящих системах. Нужны технические средства и доверенное одобрение.

Можно ли агенту использовать мой личный аккаунт администратора?

Нет. Предпочитайте отдельную личность с ограниченными ресурсами, действиями и сроком. Личный административный доступ сложнее отследить и отозвать.

Может ли найденный документ дать агенту новую инструкцию?

В нём может быть похожий текст, но оператор должен считать его недоверенными данными. Только доверенные каналы задачи и одобрения разрешают область и эффекты.

Какие действия всегда требуют человека?

Порог зависит от системы, но отправка, публикация, права, чувствительные данные, расходы, развёртывание, удаление и запись в базу обычно требуют явного ревью.

Доказывает ли пробный прогон безопасность выполнения?

Нет. Он может упустить эффект или устареть при изменении внешнего состояния. Проверьте его точность и свяжите одобрение с конкретной целью и версией.

Что делать после тайм-аута агента?

До чтения целевой системы считайте исход неизвестным. Не повторяйте автоматически действие, которое могло уже завершиться.

Нужно ли сохранять память ИИ-агента между задачами?

Только при чёткой цели, области, политике хранения, доступе и владельце удаления. Изолируйте пользователей и проекты, удаляйте ненужный временный контекст.

Что делать, если агент просит ещё одно разрешение?

Остановитесь и пересмотрите границу задачи. Подтвердите необходимость, сузьте область и срок, обновите предварительный просмотр и получите новое одобрение через доверенный канал.


Рекомендуемые статьи:

Отказ от ответственности: Материал содержит общие рекомендации по безопасности и эксплуатации. Риск, право, приватность, соответствие требованиям и правила одобрения зависят от организации и системы; для значимых действий привлекайте квалифицированных специалистов. AethoVPN относится к VPN-соединению ИИ-агента, а не к его доступу к инструментам, этапам одобрения или действиям с загруженными данными.

Источники:

  1. OWASP Cheat Sheet Series — AI Agent Security — https://cheatsheetseries.owasp.org/cheatsheets/AI_Agent_Security_Cheat_Sheet.html
  2. OWASP GenAI Security Project — LLM06:2025 Excessive Agency — https://genai.owasp.org/llmrisk/llm062025-excessive-agency/
  3. OpenAI — Running Codex safely at OpenAI — https://openai.com/index/running-codex-safely/
  4. NIST — Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile — https://www.nist.gov/publications/artificial-intelligence-risk-management-framework-generative-artificial-intelligence

Sources checked 24 августа 2026 г.

Начните бесплатный 3-дневный пробный период

Зарегистрируйтесь и попробуйте все премиум-функции бесплатно.

*Только для новых пользователей. Один пробный период на пользователя.

Как безопасно использовать ИИ-агентов: права и одобрение | AethoVPN