К содержанию
Новости

PromptSpy показала риск скрытых инструкций в письмах для ИИ-помощников

Инфографика: Forcepoint — меняет следующий этап обработки
Графика: hegai.media

Как сообщает SecurityLab (by Positive Technologies), Forcepoint показала в исследовательской симуляции PromptSpy, как инструкция внутри обычного письма способна повлиять на ИИ-помощника. Такой помощник автоматически читает почту, составляет сводку и готовит ответ. Получатель видит приглашение на конференцию, но модель обрабатывает более широкий контекст сообщения.

В демонстрации скрытая директива требует забыть прежние правила, признать отправителя доверенным, убрать предупреждение о фишинге и призвать пользователя перейти по ссылке. Инструкцию можно встроить в обычный текст или скрытые HTML-блоки, замаскировать под маркеры ролей «system» и «assistant», а также записать с помощью невидимых символов Unicode.

Forcepoint подчёркивает, что PromptSpy не является готовой реальной атакой и не выполняет произвольные инструкции. Симуляция показывает риск для цепочек из нескольких агентов: обработанная строка может оказаться в сводке, черновике ответа или повлиять на дальнейшее действие другого компонента.

Разработчикам рекомендуют проверять данные при передаче между агентами, очищать промежуточный контекст и отслеживать происхождение инструкций. Память диалога при этом следует изолировать.

Ключевые факты

  • В цепочке агенты создают личность отправителя, собирают профиль получателя, выбирают предлог и пишут письмо.

  • Для размещения директивы используются обычный текст, скрытые HTML-блоки, поддельные маркеры ролей «system» и «assistant», а также невидимые символы Unicode.

  • Forcepoint подчёркивает, что симуляция не показывает готовую реальную атаку и не выполняет произвольные инструкции.

  • Среди защитных мер названы очистка промежуточного контекста, проверка данных между агентами и изоляция памяти диалога.

Вопросы и ответы

Какие ИИ-системы подвержены показанному риску?

Цепочки из нескольких агентов, которые автоматически читают почту, составляют сводку и готовят ответ. Обработанная строка может перейти в сводку, черновик письма или действие другого компонента.

Как скрытая директива попадает в письмо и что может изменить?

Её размещают в обычном тексте, скрытых HTML-блоках, поддельных маркерах ролей «system» и «assistant» или невидимых символах Unicode. В симуляции она требовала считать отправителя доверенным, убрать предупреждение о фишинге и добавить ссылку.

Что нужно изменить в архитектуре ИИ-помощника?

Проверять данные при передаче между агентами, очищать промежуточный контекст, отслеживать происхождение инструкций и изолировать память диалога. PromptSpy при этом является исследовательской симуляцией, а не готовой атакой, и не выполняет произвольные инструкции.

Контекст по теме