Как сообщает iXBT, Veracode опубликовала отчёт GenAI Code Security Report 2026. В нём представлены результаты тестирования более 100 моделей. В четырёх тестовых срезах модели в среднем проходили проверки безопасности в 56% случаев, почти на уровне предыдущего года. При этом синтаксические тесты завершались успешно почти в 100% случаев. Примерно 44% сгенерированного кода не прошло проверку безопасности.
Специализированные модели для программирования показали средний результат 51%, универсальные набрали 52%. У крупных моделей показатель достиг 53%, у средних и малых составил 51%. Модели с режимом рассуждений справились лучше: 56% против 51% у остальных. GPT-5.5 получила 68%, но 6 из 11 представленных моделей набрали от 50% до 53%.
Результаты заметно различались и в зависимости от языка. Средний показатель для Python составил 63%, для Java всего 30%.
Veracode подчёркивает, что эти результаты нельзя считать долей уязвимого кода в реальных проектах. Тесты не учитывают статический анализ, политики, защитные ограничения и проверку человеком. Компания рекомендует проверять зависимости и сам сгенерированный код до его объединения с основной кодовой базой.
Ключевые факты
В 4 тестовых срезах более 100 моделей показали в среднем 56% успешных результатов по безопасности.
Специализированные модели для программирования набрали 51%, универсальные, 52%.
Модели с режимом рассуждений показали 56% против 51% у остальных.
Средний результат Python составил 63%, Java, 30%.
Вопросы и ответы
- Есть ли смысл выбирать специализированную модель для программирования ради безопасности?
По тестам преимущества нет: специализированные модели набрали в среднем 51%, универсальные, 52%. Режим рассуждений дал более заметную разницу: 56% против 51% у остальных моделей.
- Для каких языков риск оказался выше?
Средний результат безопасности для Python составил 63%, для Java, только 30%. Значит, при генерации Java-кода нужен особенно строгий контроль до слияния с основной кодовой базой.
- Что изменить в процессе разработки при использовании ИИ-кода?
До объединения кода с основной базой нужно проверять и зависимости, и сам сгенерированный код: около 44% тестовых примеров не прошли проверку безопасности, хотя синтаксические тесты были успешны почти в 100% случаев.
Контекст по теме
- Крупные компании в России используют вайб-кодинг, но указывают на риски безопасности18 июня 2026 г.
- «Информзащита»: 86% организаций не готовы автоматически остановить скомпрометированного ИИ-агента16 июня 2026 г.
- Исследование Checkmarx: 70% разработчиков считают ИИ‑код уязвимым, но 30% всё равно отправляют его в прод10 июня 2026 г.
- Исследование: 84% популярных российских Android‑приложений содержат уязвимости высокого или критического уровня9 июня 2026 г.
