К содержанию
Новости

Исследователи предложили подход к защите агентных ИИ-систем через контроль поведения

Инфографика: Исследователи — контроль поведения агентов
Графика: hegai.media

Авторы новой работы предлагают смотреть на безопасность агентных ИИ-систем не как на контроль отдельных действий, а как на управление всей последовательностью поведения агента в рамках заданных правил и ограничений. Речь идет о системах, которые выполняют автономные задачи в средах с операционными требованиями, внутренними политиками организаций, регуляторными нормами и техническими стандартами.

Как пишет arXiv cs.AI (Artificial Intelligence), исследование разбирает угрозы на разных уровнях агентной инфраструктуры. Для одиночных агентов потенциальными точками атаки названы промпты, память, подключенные источники знаний и интерфейсы инструментов. В сценариях с несколькими агентами авторы отдельно указывают на риски, связанные с делегированием задач и коммуникацией между агентами. В их числе вопросы идентификации, доверия, контроля возможностей и прозрачности решений.

В работе также рассматриваются угрозы на уровне маршрутизации моделей и систем управления исполнением. Здесь возможны манипуляции и использование моделей с непроверенным происхождением. Одной из ключевых проблем авторы называют «поведенческое сдерживание», то есть необходимость обеспечить, чтобы последовательность действий агента оставалась совместимой с ограничениями системы на протяжении всей работы.

Ключевые факты

  • В работе рассматриваются угрозы для промптов, памяти, подключенных источников знаний и интерфейсов инструментов.

  • Для многоагентных систем авторы выделяют риски идентификации, доверия, контроля возможностей и прозрачности решений.

  • Исследование затрагивает уязвимости в системах маршрутизации моделей и плоскости управления исполнением.

  • Одной из центральных задач названа совместимость всей последовательности действий агента с ограничениями системы.

Вопросы и ответы

Какие точки атаки исследователи считают самыми уязвимыми в агентных ИИ-системах?

Для одиночных агентов работа выделяет четыре уровня риска: промпты, память, подключенные источники знаний и интерфейсы инструментов. Для многоагентных систем добавляются угрозы при делегировании задач и коммуникации между агентами.

Что меняется в подходе к безопасности агентных ИИ по сравнению с обычной фильтрацией действий?

Авторы предлагают контролировать не отдельные действия, а всю последовательность поведения агента. Ключевая задача названа «поведенческим сдерживанием»: система должна проверять, что цепочка действий остается совместимой с внутренними политиками, регуляторными нормами и техническими ограничениями на протяжении всей работы.

Какие инфраструктурные риски исследование считает критичными для компаний с несколькими моделями и агентами?

Работа отдельно указывает на уязвимости в системах маршрутизации моделей и плоскости управления исполнением. Среди рисков названы манипуляции маршрутизацией и использование моделей с непроверенным происхождением.

Контекст по теме