Исследователи показали атаку, которая одинаково сработала против Claude Code и Codex
Исследователи безопасности Боян Миланов и Heidy Khlaaf описали атаку Friendly Fire, при которой один и тот же вредоносный payload без изменений сработал против Claude Sonnet 4.6, Claude Sonnet 5, Claude Opus 4.8 и Codex на базе GPT-5.5. По их данным, агентам для программирования было достаточно поручить поиск вредоносного кода в репозитории. После этого они сами запускали найденный payload вместо того, чтобы анализировать его.
Как сообщает Towards AI, авторы исследования считают, что проблему нельзя устранить обычным обновлением модели. В публикации AI Now Institute они пишут: модели до сих пор не умеют надежно отличать код, который нужно анализировать, от инструкций, которым следует подчиняться.
В материале отдельно отмечается, что для такой атаки не нужны необычные условия. Достаточно направить Claude Code или Codex на сторонний репозиторий или зависимость. Авторы исследования называют это фундаментальной проблемой coding-агентов, поскольку по своей задаче они должны работать с чужим кодом.
Ключевые факты
Атака «Friendly Fire» опубликована 9 июля исследователями Бояном Милановым и Heidy Khlaaf из AI Now Institute
Один и тот же payload без изменений сработал против Claude Sonnet 4.6, Claude Sonnet 5, Claude Opus 4.8 и Codex с GPT-5.5
По утверждению авторов, агенты запускали найденный вредоносный код вместо его анализа
Авторы исследования заявили, что проблему нельзя устранить простым обновлением модели