Как сообщает Together AI Blog, авторы провели 904 запуска на всех 113 задачах DeepSWE. Каждая модель получила по четыре попытки на задачу, всего по 452 запуска. GPT-5.6 Sol набрала 72,7% по метрике pass@1, а DeepSeek V4 Pro 0813 показала 62,8%. По pass@2 результаты составили 81,0% и 78,5% соответственно. Однако при четырёх попытках вперёд вышла DeepSeek V4 Pro 0813: 88,5% по pass@4 против 85,8% у GPT-5.6 Sol.
Авторы также предложили каскадную схему. Сначала задачу решает DeepSeek V4 Pro 0813, а если тесты не проходят, её передают GPT-5.6 Sol. Такой подход позволил решить 83,0% задач при стоимости 3,35 $ за задачу. Без каскада GPT-5.6 Sol решила 72,7% задач, а стоимость составила 8,37 $.
Один запуск DeepSeek V4 Pro 0813 стоил 0,24 $, что в 35 раз меньше стоимости запуска GPT-5.6 Sol за 8,37 $. При этом GPT-5.6 Sol работала быстрее: медианное время составило 17 минут и 53 шага, тогда как у DeepSeek V4 Pro 0813 было 35 минут и 146 шагов.
В 20% неудачных запусков GPT-5.6 Sol нарушала уже проходившие тесты. У DeepSeek V4 Pro 0813 этот показатель составил 11%. Поэтому авторы рекомендуют проверять результаты GPT-5.6 Sol с помощью регрессионных тестов.
Ключевые факты
В сравнении использовали 113 задач DeepSWE и выполнили 904 запуска, по 452 на каждую модель.
GPT-5.6 Sol получила 72,7% по pass@1 против 62,8% у DeepSeek V4 Pro 0813.
При четырёх попытках DeepSeek V4 Pro 0813 достигла 88,5% по pass@4, а GPT-5.6 Sol, 85,8%.
Медианное время запуска составило 17 минут для GPT-5.6 Sol и 35 минут для DeepSeek V4 Pro 0813.
Вопросы и ответы
- Сколько стоит каскад по сравнению с использованием только GPT-5.6 Sol?
Каскад стоит 3,35 $ за задачу и решает 83,0% задач. GPT-5.6 Sol без каскада стоит 8,37 $ за задачу при результате 72,7%.
- Как именно работает каскад моделей?
Сначала задачу выполняет DeepSeek V4 Pro 0813 за 0,24 $ за запуск, а при провале тестов её передают GPT-5.6 Sol. Один запуск DeepSeek стоит в 35 раз дешевле запуска GPT-5.6 Sol.
- Какие операционные различия учитывать при выборе модели?
GPT-5.6 Sol быстрее: медиана 17 минут и 53 шага против 35 минут и 146 шагов у DeepSeek. Но в 20% неудачных запусков GPT-5.6 Sol ломала ранее проходившие тесты против 11% у DeepSeek, поэтому её результаты рекомендуют проверять регрессионными тестами.
Контекст по теме
- Каскад DeepSeek V4 Pro 0813 и Claude Fable 5 достиг 82,7% на DeepSWE18 августа 2026 г.
- OpenAI представила предварительный обзор модели GPT-5.6 Sol26 июня 2026 г.
- DeepSeek V4 Pro опередил GPT-5.5 Pro в тестировании на точность выполнения задач10 июня 2026 г.
- DeepSeek-V4 представлен с MoE на 1.6T параметров, а OpenAI выпустила API GPT-5.59 июня 2026 г.