ИИ-агенты для программирования пока плохо справляются с масштабным рефакторингом. Лучший результат на SWE-Bench ProMax составил 41,2% решённых задач. Как сообщает The New Stack, бенчмарк разработали исследователи Shanghai Jiao Tong University, Peking University, Douyin Group и других организаций.
В SWE-Bench ProMax вошли 170 задач, составленных на основе реальных коммитов на Python, Java, TypeScript, Go, C, C++ и Rust. Создатели утверждают, что каждый пример прошёл многоэтапный отбор. Описания задач уточнили, наборы тестов проверили вручную. Задания недостаточной сложности или с ограниченным охватом нескольких файлов исключили.
При разработке бенчмарка авторы попытались учесть недостатки существующих методов оценки ИИ-агентов. Проведённый ими аудит показал, что почти 60% нерешённых задач SWE-bench Verified содержали некорректные тесты.
Старший директор по технической стратегии основной инфраструктуры SUSE Войтех Павлик отметил, что LLM пока не могут целиком прочитать и понять крупную кодовую базу. Главный архитектор ActiveState Шейн Уорден добавил: близость токенов сама по себе ещё не означает понимания структуры программы.
Ключевые факты
Лучший результат на SWE-Bench ProMax составил 41,2% решённых задач.
Бенчмарк включает 170 задач из реальных коммитов на Python, Java, TypeScript, Go, C, C++ и Rust.
Почти 60% нерешённых задач SWE-bench Verified в приведённом исследователями аудите содержали некорректные тесты.
При подготовке SWE-Bench ProMax авторы вручную проверяли наборы тестов и исключали задания недостаточной сложности или с ограниченным охватом нескольких файлов.
Вопросы и ответы
- Какие технологические стеки охватывает тест?
В набор входят 170 задач из реальных коммитов на Python, Java, TypeScript, Go, C, C++ и Rust.
- Чем ProMax отличается от SWE-bench Verified?
Авторы вручную проверили тесты и исключили слишком простые задания или задачи с ограниченным охватом файлов. Это устраняет часть проблем Verified: почти 60% нерешённых задач в его аудите содержали некорректные тесты.
- Можно ли уже поручать агенту крупный рефакторинг без контроля разработчика?
Пока рискованно: лучший агент решил только 41,2% задач. Эксперты также отмечают, что LLM не способны целиком понять крупную кодовую базу, а близость токенов не гарантирует понимания структуры программы.
Контекст по теме
- Veracode: ИИ проходит лишь 56% проверок безопасности при генерации кода29 июля 2026 г.
- Gemini-агент обошёл человеческий код в четырёх из пяти метрик качества5 июля 2026 г.
- Исследование Cursor: «reward hacking» завышает результаты coding‑агентов на бенчмарке SWE-bench Pro27 июня 2026 г.
- Бенчмарк ARC-AGI-3 выявил разрыв между людьми и текущими моделями9 июня 2026 г.