Veracode: ИИ проходит лишь 56% проверок безопасности при генерации кода

ИИ-модели почти всегда пишут компилируемый код, но примерно в 44% случаев добавляют уязвимости из списка OWASP Top 10. К такому выводу пришла Veracode в отчёте 2026 GenAI Code Security Report: компания протестировала более 100 моделей в четырёх срезах. Как пишет The Next Web (TNW), средний уровень прохождения проверок безопасности составил 56% против 55% годом ранее, хотя доля кода, созданного ИИ, резко выросла.
Сооснователь Veracode Крис Вайсопал отметил, что современные модели почти не ошибаются в синтаксисе, однако всё ещё проваливают почти половину задач, связанных с безопасностью. При этом исследование проводилось на «сырых» моделях, без дополнительных агентов, guardrails и ручной проверки. Поэтому результаты показывают именно частоту генерации уязвимостей, а не то, как часто такой код попадает в production.
Отчёт также показал, что специализированные модели для программирования не оказались безопаснее универсальных. Их средний результат составил 51% против 52% у general-purpose моделей. Более крупные модели тоже не дали заметного преимущества. Единственным фактором, который действительно улучшал показатели, стали reasoning-модели: в среднем они набрали 56% против 51% у остальных. Лучший результат показала OpenAI GPT-5.5, она набрала 68%, но даже эта модель проваливала почти каждую третью задачу на безопасность.
Исследование выявило заметную разницу между языками и типами уязвимостей. Python проходил проверки в 63% случаев, тогда как Java только в 30%. SQL injection и слабую криптографию модели обрабатывали существенно лучше, чем cross-site scripting и log injection. В последних двух категориях показатели опускались до 15% и 12% соответственно.
Ключевые факты
Veracode протестировала более 100 моделей в четырёх срезах для отчёта 2026 GenAI Code Security Report
Reasoning-модели показали средний результат 56% против 51% у остальных моделей
OpenAI GPT-5.5 получила лучший результат, 68%, тогда как Alibaba Qwen3.7-max набрала 50%
Cross-site scripting и log injection стали самыми проблемными категориями: уровень прохождения составил 15% и 12% соответственно
Вопросы и ответы
- Какие ИИ-модели показали лучший результат по безопасности кода и насколько это лучше остальных?
Лучший результат получила OpenAI GPT-5.5: 68% прохождения проверок безопасности. Reasoning-модели в среднем набрали 56% против 51% у остальных, а Alibaba Qwen3.7-max показала 50%.
- Какие типы уязвимостей ИИ-кодогенераторы проваливают чаще всего?
Самыми проблемными оказались cross-site scripting и log injection: проверки проходили только в 15% и 12% случаев соответственно. При этом SQL injection и слабую криптографию модели обрабатывали заметно лучше.
- Есть ли смысл выбирать специализированные coding-модели вместо универсальных ради безопасности?
По данным Veracode, специализированные модели для программирования не дали преимущества: их средний результат составил 51% против 52% у general-purpose моделей. Более крупные модели тоже не показали заметного выигрыша.
Контекст по теме
- Опрос DigiCert: 78% компаний столкнулись с инцидентами или уязвимостями, связанными с ИИ7 июля 2026 г.
- InfoWorld: разработчикам с AI всё ещё нужны инструменты для проверки кода, тестирования и инфраструктуры30 июня 2026 г.
- Компании массово останавливают AI‑проекты из‑за рисков безопасности, а специалисты ожидают дальнейшего роста угроз24 июня 2026 г.
- Анализ 112 000 коммитов: исследование о качестве кода, написанного ИИ19 июня 2026 г.