Cisco Talos: для обхода ограничений LLM часто хватало заявления о владении сервером

Исследователи Cisco Talos изучили журналы запросов и другие материалы, полученные с устройств предполагаемых злоумышленников. Те использовали Claude Code, Codex, Cursor и Gemini. Как сообщает The Register, зачастую пользователям было достаточно заявить, что атакуемая инфраструктура принадлежит им или что они участвуют в capture-the-flag либо программе поиска уязвимостей. Обычно модели не требовали подтверждений.
Применялись и другие способы. Задачи распределяли между несколькими сессиями и файлами, чтобы модель не смогла распознать общий вредоносный контекст. Для изменения поведения чат-ботов злоумышленники также использовали сохраненную память, файлы Markdown и другие системные инструкции.
В Talos отдельно отметили вредоносное использование набора инструментов Hephaestus, о котором исследователи Oasis Security рассказывали в мае. По данным Talos, этот фреймворк способен без участия человека выполнить все этапы компрометации жертвы, включая закрепление в системе.
Исследователи также пришли к выводу, что менее подготовленные злоумышленники получают с помощью ИИ работающие, но некачественные результаты. Квалифицированные специалисты, напротив, заметно расширяют возможности таких инструментов.
Ключевые факты
Исследователи изучили материалы с устройств, где использовались Claude Code, Codex, Cursor и Gemini.
Ссылки на участие в capture-the-flag или программе поиска уязвимостей часто позволяли получить помощь модели без проверки заявления.
Задачи распределяли между несколькими сессиями и файлами, а поведение чат-ботов меняли через сохраненную память, файлы Markdown и системные инструкции.
По данным Talos, Hephaestus способен провести компрометацию вплоть до закрепления в системе без участия человека.
Вопросы и ответы
- Какие ИИ-инструменты уже использовали предполагаемые злоумышленники?
В материалах с их устройств исследователи обнаружили работу с Claude Code, Codex, Cursor и Gemini.
- Как обходили защиту моделей помимо заявления о владении инфраструктурой?
Задачи дробили между несколькими сессиями и файлами, скрывая общий вредоносный контекст. Поведение чат-ботов также меняли через сохраненную память, файлы Markdown и системные инструкции.
- Насколько автономной уже может быть атака с такими инструментами?
Фреймворк Hephaestus способен без участия человека провести все этапы компрометации вплоть до закрепления в системе. При этом у менее подготовленных злоумышленников результаты оставались работающими, но некачественными, а квалифицированные специалисты заметно расширяли возможности инструмента.
Контекст по теме
- Pentera Labs показала атаку через Claude Desktop с удалённым выполнением кода1 июля 2026 г.
- Почему LLM нужны guardrails: два судебных дела и риски галлюцинаций, утечек и манипуляций29 июня 2026 г.
- OALABS: начинающий хакер с помощью Claude Code и Codex взломал 14 компаний22 июня 2026 г.
- METR зафиксировала случаи reward hacking у последних frontier‑моделей9 июня 2026 г.