Исследователи предложили подход к защите агентных ИИ-систем через контроль поведения

Авторы новой работы предлагают смотреть на безопасность агентных ИИ-систем не как на контроль отдельных действий, а как на управление всей последовательностью поведения агента в рамках заданных правил и ограничений. Речь идет о системах, которые выполняют автономные задачи в средах с операционными требованиями, внутренними политиками организаций, регуляторными нормами и техническими стандартами.
Как пишет arXiv cs.AI (Artificial Intelligence), исследование разбирает угрозы на разных уровнях агентной инфраструктуры. Для одиночных агентов потенциальными точками атаки названы промпты, память, подключенные источники знаний и интерфейсы инструментов. В сценариях с несколькими агентами авторы отдельно указывают на риски, связанные с делегированием задач и коммуникацией между агентами. В их числе вопросы идентификации, доверия, контроля возможностей и прозрачности решений.
В работе также рассматриваются угрозы на уровне маршрутизации моделей и систем управления исполнением. Здесь возможны манипуляции и использование моделей с непроверенным происхождением. Одной из ключевых проблем авторы называют «поведенческое сдерживание», то есть необходимость обеспечить, чтобы последовательность действий агента оставалась совместимой с ограничениями системы на протяжении всей работы.
Ключевые факты
В работе рассматриваются угрозы для промптов, памяти, подключенных источников знаний и интерфейсов инструментов.
Для многоагентных систем авторы выделяют риски идентификации, доверия, контроля возможностей и прозрачности решений.
Исследование затрагивает уязвимости в системах маршрутизации моделей и плоскости управления исполнением.
Одной из центральных задач названа совместимость всей последовательности действий агента с ограничениями системы.
Вопросы и ответы
- Какие точки атаки исследователи считают самыми уязвимыми в агентных ИИ-системах?
Для одиночных агентов работа выделяет четыре уровня риска: промпты, память, подключенные источники знаний и интерфейсы инструментов. Для многоагентных систем добавляются угрозы при делегировании задач и коммуникации между агентами.
- Что меняется в подходе к безопасности агентных ИИ по сравнению с обычной фильтрацией действий?
Авторы предлагают контролировать не отдельные действия, а всю последовательность поведения агента. Ключевая задача названа «поведенческим сдерживанием»: система должна проверять, что цепочка действий остается совместимой с внутренними политиками, регуляторными нормами и техническими ограничениями на протяжении всей работы.
- Какие инфраструктурные риски исследование считает критичными для компаний с несколькими моделями и агентами?
Работа отдельно указывает на уязвимости в системах маршрутизации моделей и плоскости управления исполнением. Среди рисков названы манипуляции маршрутизацией и использование моделей с непроверенным происхождением.
Контекст по теме
- Для AI-агентов предложили применять регрессионное тестирование безопасности30 июля 2026 г.
- В arXiv предложили архитектурный уровень контроля для AI‑агентов, Unfireable Safety Kernel25 июня 2026 г.
- Предложен язык протоколов для распределения ответственности между людьми и AI‑агентами в разработке ПО23 июня 2026 г.
- AgenticRei: деонтические политики для управления агентными AI‑системами во время работы19 июня 2026 г.