К содержанию
Выпуск №74 · 21 августа 2026 / Новости

SWE-Bench ProMax проверяет ИИ-агентов на масштабном рефакторинге кода

ИИ-агенты для программирования пока плохо справляются с масштабным рефакторингом. Лучший результат на SWE-Bench ProMax составил 41,2% решённых задач.

Редакция 21 августа 2026 г., 15:43 MSK

В Telegram

ИИ-агенты для программирования пока плохо справляются с масштабным рефакторингом. Лучший результат на SWE-Bench ProMax составил 41,2% решённых задач. Как сообщает The New Stack, бенчмарк разработали исследователи Shanghai Jiao Tong University, Peking University, Douyin Group и других организаций.

В SWE-Bench ProMax вошли 170 задач, составленных на основе реальных коммитов на Python, Java, TypeScript, Go, C, C++ и Rust. Создатели утверждают, что каждый пример прошёл многоэтапный отбор. Описания задач уточнили, наборы тестов проверили вручную. Задания недостаточной сложности или с ограниченным охватом нескольких файлов исключили.

При разработке бенчмарка авторы попытались учесть недостатки существующих методов оценки ИИ-агентов. Проведённый ими аудит показал, что почти 60% нерешённых задач SWE-bench Verified содержали некорректные тесты.

Старший директор по технической стратегии основной инфраструктуры SUSE Войтех Павлик отметил, что LLM пока не могут целиком прочитать и понять крупную кодовую базу. Главный архитектор ActiveState Шейн Уорден добавил: близость токенов сама по себе ещё не означает понимания структуры программы.

Ключевые факты

  • Лучший результат на SWE-Bench ProMax составил 41,2% решённых задач.

  • Бенчмарк включает 170 задач из реальных коммитов на Python, Java, TypeScript, Go, C, C++ и Rust.

  • Почти 60% нерешённых задач SWE-bench Verified в приведённом исследователями аудите содержали некорректные тесты.

  • При подготовке SWE-Bench ProMax авторы вручную проверяли наборы тестов и исключали задания недостаточной сложности или с ограниченным охватом нескольких файлов.

Вопросы и ответы

Какие технологические стеки охватывает тест?

В набор входят 170 задач из реальных коммитов на Python, Java, TypeScript, Go, C, C++ и Rust.

Чем ProMax отличается от SWE-bench Verified?

Авторы вручную проверили тесты и исключили слишком простые задания или задачи с ограниченным охватом файлов. Это устраняет часть проблем Verified: почти 60% нерешённых задач в его аудите содержали некорректные тесты.

Можно ли уже поручать агенту крупный рефакторинг без контроля разработчика?

Пока рискованно: лучший агент решил только 41,2% задач. Эксперты также отмечают, что LLM не способны целиком понять крупную кодовую базу, а близость токенов не гарантирует понимания структуры программы.

Контекст по теме

Как процитировать

«SWE-Bench ProMax проверяет ИИ-агентов на масштабном рефакторинге кода». hegai.media, 21 августа 2026 г.. https://hegai.media/novosti/swe-bench-promax-proveryaet-ii-agentov-na-masshtabnom-refaktoringe-kod--6787d184-b89e-4edb-841b-07208518fc6a

так материал выглядит в мессенджере