К содержанию
Выпуск №51 · 29 июля 2026 / Новости

Veracode: ИИ проходит лишь 56% проверок безопасности при генерации кода

ИИ-модели почти всегда пишут компилируемый код, но примерно в 44% случаев добавляют уязвимости из списка OWASP Top 10.

Редакция 29 июля 2026 г., 15:38 MSK

В Telegram
Инженер по безопасности проверяет код и аппаратный стенд с тестовыми точками.
Иллюстрация создана hegai.media с помощью ИИ

ИИ-модели почти всегда пишут компилируемый код, но примерно в 44% случаев добавляют уязвимости из списка OWASP Top 10. К такому выводу пришла Veracode в отчёте 2026 GenAI Code Security Report: компания протестировала более 100 моделей в четырёх срезах. Как пишет The Next Web (TNW), средний уровень прохождения проверок безопасности составил 56% против 55% годом ранее, хотя доля кода, созданного ИИ, резко выросла.

Сооснователь Veracode Крис Вайсопал отметил, что современные модели почти не ошибаются в синтаксисе, однако всё ещё проваливают почти половину задач, связанных с безопасностью. При этом исследование проводилось на «сырых» моделях, без дополнительных агентов, guardrails и ручной проверки. Поэтому результаты показывают именно частоту генерации уязвимостей, а не то, как часто такой код попадает в production.

Отчёт также показал, что специализированные модели для программирования не оказались безопаснее универсальных. Их средний результат составил 51% против 52% у general-purpose моделей. Более крупные модели тоже не дали заметного преимущества. Единственным фактором, который действительно улучшал показатели, стали reasoning-модели: в среднем они набрали 56% против 51% у остальных. Лучший результат показала OpenAI GPT-5.5, она набрала 68%, но даже эта модель проваливала почти каждую третью задачу на безопасность.

Исследование выявило заметную разницу между языками и типами уязвимостей. Python проходил проверки в 63% случаев, тогда как Java только в 30%. SQL injection и слабую криптографию модели обрабатывали существенно лучше, чем cross-site scripting и log injection. В последних двух категориях показатели опускались до 15% и 12% соответственно.

Ключевые факты

  • Veracode протестировала более 100 моделей в четырёх срезах для отчёта 2026 GenAI Code Security Report

  • Reasoning-модели показали средний результат 56% против 51% у остальных моделей

  • OpenAI GPT-5.5 получила лучший результат, 68%, тогда как Alibaba Qwen3.7-max набрала 50%

  • Cross-site scripting и log injection стали самыми проблемными категориями: уровень прохождения составил 15% и 12% соответственно

Вопросы и ответы

Какие ИИ-модели показали лучший результат по безопасности кода и насколько это лучше остальных?

Лучший результат получила OpenAI GPT-5.5: 68% прохождения проверок безопасности. Reasoning-модели в среднем набрали 56% против 51% у остальных, а Alibaba Qwen3.7-max показала 50%.

Какие типы уязвимостей ИИ-кодогенераторы проваливают чаще всего?

Самыми проблемными оказались cross-site scripting и log injection: проверки проходили только в 15% и 12% случаев соответственно. При этом SQL injection и слабую криптографию модели обрабатывали заметно лучше.

Есть ли смысл выбирать специализированные coding-модели вместо универсальных ради безопасности?

По данным Veracode, специализированные модели для программирования не дали преимущества: их средний результат составил 51% против 52% у general-purpose моделей. Более крупные модели тоже не показали заметного выигрыша.

Контекст по теме

Как процитировать

«Veracode: ИИ проходит лишь 56% проверок безопасности при генерации кода». hegai.media, 29 июля 2026 г.. https://hegai.media/novosti/veracode-ii-prohodit-lish-56-proverok-bezopasnosti-pri-generatsii-koda--1ca9f3bb-cb54-4a2a-a1b3-f20414cf5256

так материал выглядит в мессенджере