К содержанию
Новости

Cisco Talos: для обхода ограничений LLM часто хватало заявления о владении сервером

Инфографика: злоумышленники — не распознать общий вредоносный контекст
Графика: hegai.media

Исследователи Cisco Talos изучили журналы запросов и другие материалы, полученные с устройств предполагаемых злоумышленников. Те использовали Claude Code, Codex, Cursor и Gemini. Как сообщает The Register, зачастую пользователям было достаточно заявить, что атакуемая инфраструктура принадлежит им или что они участвуют в capture-the-flag либо программе поиска уязвимостей. Обычно модели не требовали подтверждений.

Применялись и другие способы. Задачи распределяли между несколькими сессиями и файлами, чтобы модель не смогла распознать общий вредоносный контекст. Для изменения поведения чат-ботов злоумышленники также использовали сохраненную память, файлы Markdown и другие системные инструкции.

В Talos отдельно отметили вредоносное использование набора инструментов Hephaestus, о котором исследователи Oasis Security рассказывали в мае. По данным Talos, этот фреймворк способен без участия человека выполнить все этапы компрометации жертвы, включая закрепление в системе.

Исследователи также пришли к выводу, что менее подготовленные злоумышленники получают с помощью ИИ работающие, но некачественные результаты. Квалифицированные специалисты, напротив, заметно расширяют возможности таких инструментов.

Ключевые факты

  • Исследователи изучили материалы с устройств, где использовались Claude Code, Codex, Cursor и Gemini.

  • Ссылки на участие в capture-the-flag или программе поиска уязвимостей часто позволяли получить помощь модели без проверки заявления.

  • Задачи распределяли между несколькими сессиями и файлами, а поведение чат-ботов меняли через сохраненную память, файлы Markdown и системные инструкции.

  • По данным Talos, Hephaestus способен провести компрометацию вплоть до закрепления в системе без участия человека.

Вопросы и ответы

Какие ИИ-инструменты уже использовали предполагаемые злоумышленники?

В материалах с их устройств исследователи обнаружили работу с Claude Code, Codex, Cursor и Gemini.

Как обходили защиту моделей помимо заявления о владении инфраструктурой?

Задачи дробили между несколькими сессиями и файлами, скрывая общий вредоносный контекст. Поведение чат-ботов также меняли через сохраненную память, файлы Markdown и системные инструкции.

Насколько автономной уже может быть атака с такими инструментами?

Фреймворк Hephaestus способен без участия человека провести все этапы компрометации вплоть до закрепления в системе. При этом у менее подготовленных злоумышленников результаты оставались работающими, но некачественными, а квалифицированные специалисты заметно расширяли возможности инструмента.

Контекст по теме