К содержанию
Новости

Исследование 1Password показало низкую пригодность AI-патчей для уязвимостей

Инфографика: 26% пригодные патчи
Графика: hegai.media

Исследовательская группа Off-By-1-Labs из 1Password опубликовала работу о том, как большие языковые модели справляются с созданием исправлений для сложных уязвимостей в ПО. В ходе эксперимента модели генерировали патчи для шести недавно раскрытых проблем в open source-проектах, среди которых Linux, ActiveMQ, Chrome, EXIM, SpringAI и Gemini CLI. При этом исследование было сосредоточено на общих возможностях современных LLM, а не на сравнении конкретных моделей.

Как сообщает ZDNet, пригодными к использованию оказались только 26% сгенерированных патчей. Еще в 21% случаев исправления действительно устраняли ошибку, но при этом меняли поведение приложения. В 53,9% попыток модели либо не исправляли уязвимость, либо добавляли новые ошибки, либо совмещали оба сценария.

Авторы исследования назвали такие результаты FLAWED (Fix-Like Artifacts With Embedded Defects). Речь идет о патчах, которые выглядят корректно, но не закрывают проблему полностью, используют ненадежные механизмы защиты или создают дополнительные дефекты. Для эксперимента исследователи использовали 6 080 попыток генерации патчей с разными условиями среды и девятью вариантами промптов для каждой уязвимости.

В 1Password считают, что сейчас LLM полезнее применять для поиска и приоритизации уязвимостей, а не для автоматического исправления кода. Компания также выложила инструментарий FLAWED на GitHub для дальнейших исследований.

Ключевые факты

  • В исследовании участвовали Claude и модель на базе агента Codex от OpenAI

  • Для тестов выбрали шесть недавно раскрытых уязвимостей, которые, как предполагалось, не попали в обучающие данные моделей

  • LLM сгенерировали 6 080 вариантов патчей при разных условиях среды и девяти промптах для каждой уязвимости

  • Исследователи ожидали успешность исправлений около 67%, но итоговые результаты оказались значительно ниже