PromptSpy показала риск скрытых инструкций в письмах для ИИ-помощников

Как сообщает SecurityLab (by Positive Technologies), Forcepoint показала в исследовательской симуляции PromptSpy, как инструкция внутри обычного письма способна повлиять на ИИ-помощника. Такой помощник автоматически читает почту, составляет сводку и готовит ответ. Получатель видит приглашение на конференцию, но модель обрабатывает более широкий контекст сообщения.
В демонстрации скрытая директива требует забыть прежние правила, признать отправителя доверенным, убрать предупреждение о фишинге и призвать пользователя перейти по ссылке. Инструкцию можно встроить в обычный текст или скрытые HTML-блоки, замаскировать под маркеры ролей «system» и «assistant», а также записать с помощью невидимых символов Unicode.
Forcepoint подчёркивает, что PromptSpy не является готовой реальной атакой и не выполняет произвольные инструкции. Симуляция показывает риск для цепочек из нескольких агентов: обработанная строка может оказаться в сводке, черновике ответа или повлиять на дальнейшее действие другого компонента.
Разработчикам рекомендуют проверять данные при передаче между агентами, очищать промежуточный контекст и отслеживать происхождение инструкций. Память диалога при этом следует изолировать.
Ключевые факты
В цепочке агенты создают личность отправителя, собирают профиль получателя, выбирают предлог и пишут письмо.
Для размещения директивы используются обычный текст, скрытые HTML-блоки, поддельные маркеры ролей «system» и «assistant», а также невидимые символы Unicode.
Forcepoint подчёркивает, что симуляция не показывает готовую реальную атаку и не выполняет произвольные инструкции.
Среди защитных мер названы очистка промежуточного контекста, проверка данных между агентами и изоляция памяти диалога.
Вопросы и ответы
- Какие ИИ-системы подвержены показанному риску?
Цепочки из нескольких агентов, которые автоматически читают почту, составляют сводку и готовят ответ. Обработанная строка может перейти в сводку, черновик письма или действие другого компонента.
- Как скрытая директива попадает в письмо и что может изменить?
Её размещают в обычном тексте, скрытых HTML-блоках, поддельных маркерах ролей «system» и «assistant» или невидимых символах Unicode. В симуляции она требовала считать отправителя доверенным, убрать предупреждение о фишинге и добавить ссылку.
- Что нужно изменить в архитектуре ИИ-помощника?
Проверять данные при передаче между агентами, очищать промежуточный контекст, отслеживать происхождение инструкций и изолировать память диалога. PromptSpy при этом является исследовательской симуляцией, а не готовой атакой, и не выполняет произвольные инструкции.
Контекст по теме
- Check Point: ИИ ускорил путь от уязвимости до готовой атаки до нескольких часов15 июля 2026 г.
- Исследователи описали атаку HalluSquatting на ИИ-агентов через вымышленные репозитории11 июля 2026 г.
- Sysdig описала атаку-вымогатель JadePuffer с автономным поведением ИИ6 июля 2026 г.
- Предсказуемые имена хранилищ Google позволяли получить доступ к ИИ‑моделям за 2,5 секунды18 июня 2026 г.