К содержанию
Выпуск №69 · 16 августа 2026 / Новости

Тесты Veracode выявили разрыв между работоспособностью и безопасностью ИИ-кода

Как сообщает iXBT, Veracode опубликовала отчёт GenAI Code Security Report 2026. В нём представлены результаты тестирования более 100 моделей.

Редакция 16 августа 2026 г., 18:00 MSK

В Telegram
Абстрактная графика hegai.media: широкие лучи, расходящиеся из одной точки, поверх тонкой лучевой разметки
Графика: hegai.media

Источник

iXBT

Как сообщает iXBT, Veracode опубликовала отчёт GenAI Code Security Report 2026. В нём представлены результаты тестирования более 100 моделей. В четырёх тестовых срезах модели в среднем проходили проверки безопасности в 56% случаев, почти на уровне предыдущего года. При этом синтаксические тесты завершались успешно почти в 100% случаев. Примерно 44% сгенерированного кода не прошло проверку безопасности.

Специализированные модели для программирования показали средний результат 51%, универсальные набрали 52%. У крупных моделей показатель достиг 53%, у средних и малых составил 51%. Модели с режимом рассуждений справились лучше: 56% против 51% у остальных. GPT-5.5 получила 68%, но 6 из 11 представленных моделей набрали от 50% до 53%.

Результаты заметно различались и в зависимости от языка. Средний показатель для Python составил 63%, для Java всего 30%.

Veracode подчёркивает, что эти результаты нельзя считать долей уязвимого кода в реальных проектах. Тесты не учитывают статический анализ, политики, защитные ограничения и проверку человеком. Компания рекомендует проверять зависимости и сам сгенерированный код до его объединения с основной кодовой базой.

Ключевые факты

  • В 4 тестовых срезах более 100 моделей показали в среднем 56% успешных результатов по безопасности.

  • Специализированные модели для программирования набрали 51%, универсальные, 52%.

  • Модели с режимом рассуждений показали 56% против 51% у остальных.

  • Средний результат Python составил 63%, Java, 30%.

Вопросы и ответы

Есть ли смысл выбирать специализированную модель для программирования ради безопасности?

По тестам преимущества нет: специализированные модели набрали в среднем 51%, универсальные, 52%. Режим рассуждений дал более заметную разницу: 56% против 51% у остальных моделей.

Для каких языков риск оказался выше?

Средний результат безопасности для Python составил 63%, для Java, только 30%. Значит, при генерации Java-кода нужен особенно строгий контроль до слияния с основной кодовой базой.

Что изменить в процессе разработки при использовании ИИ-кода?

До объединения кода с основной базой нужно проверять и зависимости, и сам сгенерированный код: около 44% тестовых примеров не прошли проверку безопасности, хотя синтаксические тесты были успешны почти в 100% случаев.

Контекст по теме

Как процитировать

«Тесты Veracode выявили разрыв между работоспособностью и безопасностью ИИ-кода». hegai.media, 16 августа 2026 г.. https://hegai.media/novosti/testy-veracode-vyyavili-razryv-mezhdu-rabotosposobnostyu-i-bezopasnost--83fd54d8-13df-413c-a25f-c0db50f9a22f

так материал выглядит в мессенджере