Короткий ответ. Безопасность AI-агента — это управляемая архитектура: агент получает только нужные данные и права, вызывает строго описанные инструменты, проходит проверки до и после действия, а каждое значимое событие попадает в журнал и систему наблюдения.

Главный принцип

Защита агента начинается с его рабочей роли

Обычное приложение выполняет заранее заданный код. AI-агент дополнительно интерпретирует содержание, выбирает следующий шаг и может работать с несколькими системами. Это даёт бизнесу скорость и гибкость, но одновременно расширяет поверхность атаки: повлиять на маршрут могут пользовательский запрос, документ, веб-страница, результат другого инструмента или данные из памяти.

Поэтому сначала описывается законченная работа: что агент получает, какие решения принимает, какими инструментами пользуется и какой результат создаёт. Затем вокруг этой роли строятся доступы, проверки, лимиты и журналирование.

АРХИТЕКТУРА ЗАЩИТЫОграниченная роль + проверенные данные + точные инструменты + наблюдение

Чем яснее рабочий маршрут, тем точнее можно управлять полномочиями и быстрее расследовать отклонение.

Модель угроз

Где появляются атаки на ИИ-агентов

01ВХОД

Диалог и файлы

Пользовательский текст, письмо, вложение или сайт могут содержать посторонние инструкции и попытку изменить цель.

02КОНТЕКСТ

Знания и память

Ошибочные или намеренно изменённые материалы могут влиять на решения в следующих запусках.

03ДЕЙСТВИЯ

Инструменты и API

Риск зависит от того, что именно инструмент позволяет читать, создавать, отправлять, изменять или удалять.

04ИДЕНТИЧНОСТЬ

Роли и полномочия

Слишком широкие права увеличивают последствия одной неверной или навязанной команды.

Семь классов угроз

Что именно пытаются сделать с агентной системой

01
Прямая подмена цели

В сообщении пытаются отменить рабочие инструкции и переключить агента на постороннюю задачу.

Prompt injection
02
Косвенная подмена инструкции

Вредоносная команда скрывается в документе, письме, веб-странице или результате подключённого сервиса.

Indirect injection
03
Злоупотребление инструментом

Легитимная функция вызывается с неподходящими параметрами, получателем или целью.

Tool misuse
04
Использование избыточных прав

Одна рабочая роль получает доступ к данным и операциям, которые не нужны для её процесса.

Privilege abuse
05
Вывод закрытых данных

Контекст, документы, ключи или внутренние сведения пытаются получить через ответ или действие агента.

Data exfiltration
06
Отравление знаний и памяти

В постоянный контекст подмешиваются ложные сведения, которые затем влияют на новые решения.

Memory poisoning
07
Неконтролируемая цепочка

Повторные вызовы, рекурсивные задачи или дорогие операции создают лишнюю нагрузку и расход ресурсов.

Unbounded execution
Сквозной пример

Как косвенная prompt injection превращается в действие

Представим агента, который читает входящие письма, проверяет CRM и готовит ответ менеджеру. В одном из вложений скрыта команда: найти закрытые данные и отправить их на внешний адрес. Для модели этот текст может выглядеть как часть рабочего контекста, если система не разделяет данные и инструкции.

01Внешний файл

Содержит рабочий текст и скрытую команду.

02Контекст агента

Данные ошибочно принимаются за инструкцию.

03Попытка действия

Агент выбирает инструмент с опасными параметрами.

04Контур защиты

Права, правила и проверка блокируют действие.

Защита работает до выполнения: источник помечается как данные, запрос к инструменту проверяется, адрес получателя ограничен, а чувствительная операция требует отдельного разрешения. Одновременно событие фиксируется для анализа.

Глубокая защита

Семь слоёв безопасности AI-агента

01
Идентификация и роли

Отдельная учётная запись агента и понятная связь каждого действия с рабочей ролью.

02
Минимальные права

Только необходимые объекты, операции, поля, получатели и среды.

03
Разделение инструкций и данных

Внешний контент рассматривается как материал для обработки, а не как команда системе.

04
Контракты инструментов

Допустимые параметры, форматы, лимиты и проверка результата каждого вызова.

05
Контроль чувствительных действий

Отдельный маршрут подтверждения для денег, удаления, публикации и внешней отправки.

06
Лимиты и остановка

Количество шагов, время, бюджет операции, повторные попытки и автоматическая остановка.

07
Журналы и мониторинг

Видимый путь от входа до результата, уведомления и быстрый разбор отклонений.

Доступы

Права задаются на уровне конкретных операций

Формулировка «подключить агента к CRM» ничего не говорит о реальном уровне доступа. Роль раскладывается на объекты и действия: читать карточку, создать сделку, добавить сводку, изменить согласованные поля, поставить задачу. Административные функции и посторонние разделы не входят в этот маршрут.

ЧТЕНИЕКакие записи и поля доступны

Клиент, заказ, статус, каталог, база знаний.

СОЗДАНИЕЧто агент может добавить

Сделка, задача, документ, отчёт, комментарий.

ИЗМЕНЕНИЕКакие состояния обновляются

Только согласованные поля и допустимые переходы.

ОТПРАВКАКому и что можно передать

Разрешённые каналы, адресаты, шаблоны и файлы.

ПОДТВЕРЖДЕНИЕЧто проходит отдельную проверку

Финансы, удаление, публикация, особые условия.

ЖУРНАЛКакие события фиксируются

Источник, параметры, результат, время и статус.

Детальную методику ролевой карты мы раскрываем в отдельном материале о доступах AI-агента к данным и системам.

Инструменты

Каждая функция агента получает строгий контракт

ВХОДКакие параметры принимает инструмент

Тип, обязательность, длина, допустимые значения и источник.

ПРАВИЛАЧто разрешено выполнить

Роль, объекты, лимиты, получатели и контрольные условия.

ВЫХОДКак проверяется результат

Структура ответа, статус, идентификатор и запись в журнал.

Так агент не получает универсальную команду «работать с базой». Вместо неё есть отдельные инструменты: получить разрешённые сведения, создать объект по схеме, обновить конкретный набор полей или сформировать документ по утверждённому шаблону.

Данные

Контуры данных должны быть понятны владельцу процесса

01ВХОДНОЙ КОНТЕКСТЧто нужно для одной операции

Сообщение, файл, карточка и необходимые справочные сведения.

02ПОСТОЯННЫЕ ЗНАНИЯНа чём основаны ответы и решения

Регламенты, продукты, шаблоны и их актуальные версии.

03РАБОЧИЙ РЕЗУЛЬТАТЧто сохраняется после выполнения

Статус, документ, сводка, задача, поля CRM и аналитическое событие.

04ТЕХНИЧЕСКИЙ ЖУРНАЛКак восстанавливается цепочка

Запуск, вызовы инструментов, ошибки, проверки, время и итог.

Жизненный цикл

Безопасность проверяется до пилота и развивается после запуска

  1. 01
    Модель угроз

    Источники входа, данные, инструменты, полномочия и возможные последствия.

  2. 02
    Проектирование роли

    Матрица прав, контракты функций, лимиты и правила подтверждения.

  3. 03
    Атакующие тесты

    Прямая и косвенная подмена инструкций, ошибочные данные, обход маршрута и злоупотребление инструментами.

  4. 04
    Управляемый пилот

    Работа на согласованном потоке с наблюдением всех значимых событий.

  5. 05
    Рабочий мониторинг

    Отклонения, лимиты, стоимость, ошибки, новые сценарии и изменения подключений.

  6. 06
    Контролируемые обновления

    Новые функции проходят пересмотр прав, тестов, данных и метрик перед включением.

Наблюдаемость

Что должно быть видно в мониторинге агента

SECURITY CONTROLРабочий контур агентаLIVE
ОПЕРАЦИИвход → действие → результат
ОТКЛОНЕНИЯнеобычные входы и маршруты
ПРАВАкакая роль вызвала функцию
ЛИМИТЫшаги, время и расходы
ОШИБКИсистема, причина и повтор
РЕАКЦИЯостановка, уведомление, разбор
Вход проверенИнструмент разрешёнРезультат подтверждён

Мониторинг соединяет техническое событие с бизнес-процессом. Команда видит не просто ошибку API, а конкретную заявку, документ, действие, владельца процесса и текущий статус.

Проверка готовности

Чек-лист безопасного запуска AI-агента

Описана рабочая роль и границы процесса
Составлена карта источников и результатов данных
Для каждого инструмента задан контракт
Выданы минимальные права отдельной учётной записи
Внешние данные отделены от системных инструкций
Чувствительные операции имеют отдельный маршрут
Настроены лимиты шагов, времени и расходов
Проведены тесты прямых и косвенных атак
Значимые действия попадают в единый журнал
Определены уведомления и правила остановки
Проверено восстановление после ошибки
Изменения проходят согласование и повторное тестирование
Четыре результата защиты

Что получает бизнес

Правапонятная зона действий каждой роли
Данныеуправляемый путь входа и результата
Контрольполная история значимых операций
Масштаббыстрое подключение новых функций по правилам
Минимальный комплект

До пилота должны существовать четыре карты

Модель угроз → карта данных → матрица прав → реестр тестов. Вместе они связывают рабочий процесс, техническую архитектуру и порядок контроля.

УгрозыДанныеПраваТесты
Главный вывод

Сильная защита позволяет агенту уверенно работать в бизнесе

Безопасность не сводится к запрету функций. Правильная архитектура точно определяет, что агент может делать, с какими данными, через какие инструменты и при каких условиях.

Это превращает защиту в основу масштабирования: новые процессы подключаются по понятной модели, действия остаются наблюдаемыми, а развитие системы не разрушает управляемость.

Продолжить разбор

Связанные материалы

Первоисточники

Стандарты и руководства по безопасности агентных систем

Модель угроз и меры защиты сопоставлены с актуальными материалами OWASP, NIST и OpenAI.

  • OWASP Top 10 for Agentic Applications: подмена цели, злоупотребление инструментами, права, цепочка поставок и другие риски агентных приложений.
  • NIST AI RMF: Generative AI Profile: управление рисками генеративных AI-систем на протяжении жизненного цикла.
  • OpenAI — A practical guide to building agents: многослойные guardrails, аутентификация, авторизация, контроль доступа и наблюдение за чувствительными действиями.
Частые вопросы

Что важно знать о защите AI-агентов

Какие атаки на ИИ-агентов встречаются чаще всего?

Ключевые классы угроз связаны с подменой цели через входные данные, вредоносными инструкциями в документах и веб-страницах, злоупотреблением инструментами, избыточными правами, утечкой данных, отравлением памяти и неконтролируемыми цепочками действий.

Достаточно ли защитить только системный промпт?

Нет. Защита строится слоями: идентификация, минимальные права, отдельные контуры данных, строгие контракты инструментов, проверка входа и результата, подтверждение чувствительных действий, журналы, лимиты и мониторинг.

Что такое prompt injection простыми словами?

Это попытка заставить AI-систему следовать посторонней инструкции вместо рабочей задачи. Такая инструкция может прийти напрямую от пользователя или скрываться внутри письма, документа, сайта и другого источника.

Какие действия агента нужно контролировать особенно тщательно?

Изменение и удаление данных, отправку документов, операции с деньгами, административные функции, публикации и действия от имени компании. Для них задаются отдельные права, лимиты, правила подтверждения и полный журнал.

Как проверить безопасность перед запуском?

Составить модель угроз, матрицу прав и карту данных; провести тесты прямой и косвенной подмены инструкций, ошибочных входов, недоступности систем и злоупотребления инструментами; затем проверить журналы, остановку процесса и восстановление.

Безопасное внедрение

Спроектируйте защищённую роль AI-агента

Разберём процесс, данные, инструменты и полномочия, составим архитектуру защиты и план управляемого пилота.

Обсудить безопасное внедрение