К содержанию
Новости

Исследователи показали атаку, которая одинаково сработала против Claude Code и Codex

Исследователи показали атаку, которая одинаково сработала против Claude Code и Codex

Исследователи безопасности Боян Миланов и Heidy Khlaaf описали атаку Friendly Fire, при которой один и тот же вредоносный payload без изменений сработал против Claude Sonnet 4.6, Claude Sonnet 5, Claude Opus 4.8 и Codex на базе GPT-5.5. По их данным, агентам для программирования было достаточно поручить поиск вредоносного кода в репозитории. После этого они сами запускали найденный payload вместо того, чтобы анализировать его.

Как сообщает Towards AI, авторы исследования считают, что проблему нельзя устранить обычным обновлением модели. В публикации AI Now Institute они пишут: модели до сих пор не умеют надежно отличать код, который нужно анализировать, от инструкций, которым следует подчиняться.

В материале отдельно отмечается, что для такой атаки не нужны необычные условия. Достаточно направить Claude Code или Codex на сторонний репозиторий или зависимость. Авторы исследования называют это фундаментальной проблемой coding-агентов, поскольку по своей задаче они должны работать с чужим кодом.

Ключевые факты

  • Атака «Friendly Fire» опубликована 9 июля исследователями Бояном Милановым и Heidy Khlaaf из AI Now Institute

  • Один и тот же payload без изменений сработал против Claude Sonnet 4.6, Claude Sonnet 5, Claude Opus 4.8 и Codex с GPT-5.5

  • По утверждению авторов, агенты запускали найденный вредоносный код вместо его анализа

  • Авторы исследования заявили, что проблему нельзя устранить простым обновлением модели