Короткий ответ. Безопасность AI-агента — это управляемая архитектура: агент получает только нужные данные и права, вызывает строго описанные инструменты, проходит проверки до и после действия, а каждое значимое событие попадает в журнал и систему наблюдения.
Защита агента начинается с его рабочей роли
Обычное приложение выполняет заранее заданный код. AI-агент дополнительно интерпретирует содержание, выбирает следующий шаг и может работать с несколькими системами. Это даёт бизнесу скорость и гибкость, но одновременно расширяет поверхность атаки: повлиять на маршрут могут пользовательский запрос, документ, веб-страница, результат другого инструмента или данные из памяти.
Поэтому сначала описывается законченная работа: что агент получает, какие решения принимает, какими инструментами пользуется и какой результат создаёт. Затем вокруг этой роли строятся доступы, проверки, лимиты и журналирование.
Чем яснее рабочий маршрут, тем точнее можно управлять полномочиями и быстрее расследовать отклонение.
Где появляются атаки на ИИ-агентов
Диалог и файлы
Пользовательский текст, письмо, вложение или сайт могут содержать посторонние инструкции и попытку изменить цель.
Знания и память
Ошибочные или намеренно изменённые материалы могут влиять на решения в следующих запусках.
Инструменты и API
Риск зависит от того, что именно инструмент позволяет читать, создавать, отправлять, изменять или удалять.
Роли и полномочия
Слишком широкие права увеличивают последствия одной неверной или навязанной команды.
Что именно пытаются сделать с агентной системой
В сообщении пытаются отменить рабочие инструкции и переключить агента на постороннюю задачу.
Вредоносная команда скрывается в документе, письме, веб-странице или результате подключённого сервиса.
Легитимная функция вызывается с неподходящими параметрами, получателем или целью.
Одна рабочая роль получает доступ к данным и операциям, которые не нужны для её процесса.
Контекст, документы, ключи или внутренние сведения пытаются получить через ответ или действие агента.
В постоянный контекст подмешиваются ложные сведения, которые затем влияют на новые решения.
Повторные вызовы, рекурсивные задачи или дорогие операции создают лишнюю нагрузку и расход ресурсов.
Как косвенная prompt injection превращается в действие
Представим агента, который читает входящие письма, проверяет CRM и готовит ответ менеджеру. В одном из вложений скрыта команда: найти закрытые данные и отправить их на внешний адрес. Для модели этот текст может выглядеть как часть рабочего контекста, если система не разделяет данные и инструкции.
Содержит рабочий текст и скрытую команду.
Данные ошибочно принимаются за инструкцию.
Агент выбирает инструмент с опасными параметрами.
Права, правила и проверка блокируют действие.
Защита работает до выполнения: источник помечается как данные, запрос к инструменту проверяется, адрес получателя ограничен, а чувствительная операция требует отдельного разрешения. Одновременно событие фиксируется для анализа.
Семь слоёв безопасности AI-агента
Отдельная учётная запись агента и понятная связь каждого действия с рабочей ролью.
Только необходимые объекты, операции, поля, получатели и среды.
Внешний контент рассматривается как материал для обработки, а не как команда системе.
Допустимые параметры, форматы, лимиты и проверка результата каждого вызова.
Отдельный маршрут подтверждения для денег, удаления, публикации и внешней отправки.
Количество шагов, время, бюджет операции, повторные попытки и автоматическая остановка.
Видимый путь от входа до результата, уведомления и быстрый разбор отклонений.
Права задаются на уровне конкретных операций
Формулировка «подключить агента к CRM» ничего не говорит о реальном уровне доступа. Роль раскладывается на объекты и действия: читать карточку, создать сделку, добавить сводку, изменить согласованные поля, поставить задачу. Административные функции и посторонние разделы не входят в этот маршрут.
Клиент, заказ, статус, каталог, база знаний.
Сделка, задача, документ, отчёт, комментарий.
Только согласованные поля и допустимые переходы.
Разрешённые каналы, адресаты, шаблоны и файлы.
Финансы, удаление, публикация, особые условия.
Источник, параметры, результат, время и статус.
Детальную методику ролевой карты мы раскрываем в отдельном материале о доступах AI-агента к данным и системам.
Каждая функция агента получает строгий контракт
Тип, обязательность, длина, допустимые значения и источник.
Роль, объекты, лимиты, получатели и контрольные условия.
Структура ответа, статус, идентификатор и запись в журнал.
Так агент не получает универсальную команду «работать с базой». Вместо неё есть отдельные инструменты: получить разрешённые сведения, создать объект по схеме, обновить конкретный набор полей или сформировать документ по утверждённому шаблону.
Контуры данных должны быть понятны владельцу процесса
Сообщение, файл, карточка и необходимые справочные сведения.
Регламенты, продукты, шаблоны и их актуальные версии.
Статус, документ, сводка, задача, поля CRM и аналитическое событие.
Запуск, вызовы инструментов, ошибки, проверки, время и итог.
Безопасность проверяется до пилота и развивается после запуска
- 01Модель угроз
Источники входа, данные, инструменты, полномочия и возможные последствия.
- 02Проектирование роли
Матрица прав, контракты функций, лимиты и правила подтверждения.
- 03Атакующие тесты
Прямая и косвенная подмена инструкций, ошибочные данные, обход маршрута и злоупотребление инструментами.
- 04Управляемый пилот
Работа на согласованном потоке с наблюдением всех значимых событий.
- 05Рабочий мониторинг
Отклонения, лимиты, стоимость, ошибки, новые сценарии и изменения подключений.
- 06Контролируемые обновления
Новые функции проходят пересмотр прав, тестов, данных и метрик перед включением.
Что должно быть видно в мониторинге агента
Мониторинг соединяет техническое событие с бизнес-процессом. Команда видит не просто ошибку API, а конкретную заявку, документ, действие, владельца процесса и текущий статус.
Чек-лист безопасного запуска AI-агента
Что получает бизнес
До пилота должны существовать четыре карты
Модель угроз → карта данных → матрица прав → реестр тестов. Вместе они связывают рабочий процесс, техническую архитектуру и порядок контроля.
Сильная защита позволяет агенту уверенно работать в бизнесе
Безопасность не сводится к запрету функций. Правильная архитектура точно определяет, что агент может делать, с какими данными, через какие инструменты и при каких условиях.
Это превращает защиту в основу масштабирования: новые процессы подключаются по понятной модели, действия остаются наблюдаемыми, а развитие системы не разрушает управляемость.
Стандарты и руководства по безопасности агентных систем
Модель угроз и меры защиты сопоставлены с актуальными материалами OWASP, NIST и OpenAI.
- OWASP Top 10 for Agentic Applications: подмена цели, злоупотребление инструментами, права, цепочка поставок и другие риски агентных приложений.
- NIST AI RMF: Generative AI Profile: управление рисками генеративных AI-систем на протяжении жизненного цикла.
- OpenAI — A practical guide to building agents: многослойные guardrails, аутентификация, авторизация, контроль доступа и наблюдение за чувствительными действиями.
Что важно знать о защите AI-агентов
Какие атаки на ИИ-агентов встречаются чаще всего?
Ключевые классы угроз связаны с подменой цели через входные данные, вредоносными инструкциями в документах и веб-страницах, злоупотреблением инструментами, избыточными правами, утечкой данных, отравлением памяти и неконтролируемыми цепочками действий.
Достаточно ли защитить только системный промпт?
Нет. Защита строится слоями: идентификация, минимальные права, отдельные контуры данных, строгие контракты инструментов, проверка входа и результата, подтверждение чувствительных действий, журналы, лимиты и мониторинг.
Что такое prompt injection простыми словами?
Это попытка заставить AI-систему следовать посторонней инструкции вместо рабочей задачи. Такая инструкция может прийти напрямую от пользователя или скрываться внутри письма, документа, сайта и другого источника.
Какие действия агента нужно контролировать особенно тщательно?
Изменение и удаление данных, отправку документов, операции с деньгами, административные функции, публикации и действия от имени компании. Для них задаются отдельные права, лимиты, правила подтверждения и полный журнал.
Как проверить безопасность перед запуском?
Составить модель угроз, матрицу прав и карту данных; провести тесты прямой и косвенной подмены инструкций, ошибочных входов, недоступности систем и злоупотребления инструментами; затем проверить журналы, остановку процесса и восстановление.
Спроектируйте защищённую роль AI-агента
Разберём процесс, данные, инструменты и полномочия, составим архитектуру защиты и план управляемого пилота.