К содержанию
Новости

Veracode: ИИ проходит лишь 56% проверок безопасности при генерации кода

Чёрные модульные детали проходят через металлическую проверочную решётку, где часть из них застревает.
Иллюстрация создана hegai.media с помощью ИИ

ИИ-модели почти всегда пишут компилируемый код, но примерно в 44% случаев добавляют уязвимости из списка OWASP Top 10. К такому выводу пришла Veracode в отчёте 2026 GenAI Code Security Report: компания протестировала более 100 моделей в четырёх срезах. Как пишет The Next Web (TNW), средний уровень прохождения проверок безопасности составил 56% против 55% годом ранее, хотя доля кода, созданного ИИ, резко выросла.

Сооснователь Veracode Крис Вайсопал отметил, что современные модели почти не ошибаются в синтаксисе, однако всё ещё проваливают почти половину задач, связанных с безопасностью. При этом исследование проводилось на «сырых» моделях, без дополнительных агентов, guardrails и ручной проверки. Поэтому результаты показывают именно частоту генерации уязвимостей, а не то, как часто такой код попадает в production.

Отчёт также показал, что специализированные модели для программирования не оказались безопаснее универсальных. Их средний результат составил 51% против 52% у general-purpose моделей. Более крупные модели тоже не дали заметного преимущества. Единственным фактором, который действительно улучшал показатели, стали reasoning-модели: в среднем они набрали 56% против 51% у остальных. Лучший результат показала OpenAI GPT-5.5, она набрала 68%, но даже эта модель проваливала почти каждую третью задачу на безопасность.

Исследование выявило заметную разницу между языками и типами уязвимостей. Python проходил проверки в 63% случаев, тогда как Java только в 30%. SQL injection и слабую криптографию модели обрабатывали существенно лучше, чем cross-site scripting и log injection. В последних двух категориях показатели опускались до 15% и 12% соответственно.

Ключевые факты

  • Veracode протестировала более 100 моделей в четырёх срезах для отчёта 2026 GenAI Code Security Report

  • Reasoning-модели показали средний результат 56% против 51% у остальных моделей

  • OpenAI GPT-5.5 получила лучший результат, 68%, тогда как Alibaba Qwen3.7-max набрала 50%

  • Cross-site scripting и log injection стали самыми проблемными категориями: уровень прохождения составил 15% и 12% соответственно

Вопросы и ответы

Какие ИИ-модели показали лучший результат по безопасности кода и насколько это лучше остальных?

Лучший результат получила OpenAI GPT-5.5: 68% прохождения проверок безопасности. Reasoning-модели в среднем набрали 56% против 51% у остальных, а Alibaba Qwen3.7-max показала 50%.

Какие типы уязвимостей ИИ-кодогенераторы проваливают чаще всего?

Самыми проблемными оказались cross-site scripting и log injection: проверки проходили только в 15% и 12% случаев соответственно. При этом SQL injection и слабую криптографию модели обрабатывали заметно лучше.

Есть ли смысл выбирать специализированные coding-модели вместо универсальных ради безопасности?

По данным Veracode, специализированные модели для программирования не дали преимущества: их средний результат составил 51% против 52% у general-purpose моделей. Более крупные модели тоже не показали заметного выигрыша.

Контекст по теме