К содержанию
Выпуск №71 · 18 августа 2026 / Новости

Каскад DeepSeek V4 Pro 0813 и GPT-5.6 Sol достиг 83,0% на DeepSWE

Как сообщает Together AI Blog, авторы провели 904 запуска на всех 113 задачах DeepSWE. Каждая модель получила по четыре попытки на задачу, всего по 452 запуска.

Редакция 18 августа 2026 г., 12:09 MSK

В Telegram

Как сообщает Together AI Blog, авторы провели 904 запуска на всех 113 задачах DeepSWE. Каждая модель получила по четыре попытки на задачу, всего по 452 запуска. GPT-5.6 Sol набрала 72,7% по метрике pass@1, а DeepSeek V4 Pro 0813 показала 62,8%. По pass@2 результаты составили 81,0% и 78,5% соответственно. Однако при четырёх попытках вперёд вышла DeepSeek V4 Pro 0813: 88,5% по pass@4 против 85,8% у GPT-5.6 Sol.

Авторы также предложили каскадную схему. Сначала задачу решает DeepSeek V4 Pro 0813, а если тесты не проходят, её передают GPT-5.6 Sol. Такой подход позволил решить 83,0% задач при стоимости 3,35 $ за задачу. Без каскада GPT-5.6 Sol решила 72,7% задач, а стоимость составила 8,37 $.

Один запуск DeepSeek V4 Pro 0813 стоил 0,24 $, что в 35 раз меньше стоимости запуска GPT-5.6 Sol за 8,37 $. При этом GPT-5.6 Sol работала быстрее: медианное время составило 17 минут и 53 шага, тогда как у DeepSeek V4 Pro 0813 было 35 минут и 146 шагов.

В 20% неудачных запусков GPT-5.6 Sol нарушала уже проходившие тесты. У DeepSeek V4 Pro 0813 этот показатель составил 11%. Поэтому авторы рекомендуют проверять результаты GPT-5.6 Sol с помощью регрессионных тестов.

Ключевые факты

  • В сравнении использовали 113 задач DeepSWE и выполнили 904 запуска, по 452 на каждую модель.

  • GPT-5.6 Sol получила 72,7% по pass@1 против 62,8% у DeepSeek V4 Pro 0813.

  • При четырёх попытках DeepSeek V4 Pro 0813 достигла 88,5% по pass@4, а GPT-5.6 Sol, 85,8%.

  • Медианное время запуска составило 17 минут для GPT-5.6 Sol и 35 минут для DeepSeek V4 Pro 0813.

Вопросы и ответы

Сколько стоит каскад по сравнению с использованием только GPT-5.6 Sol?

Каскад стоит 3,35 $ за задачу и решает 83,0% задач. GPT-5.6 Sol без каскада стоит 8,37 $ за задачу при результате 72,7%.

Как именно работает каскад моделей?

Сначала задачу выполняет DeepSeek V4 Pro 0813 за 0,24 $ за запуск, а при провале тестов её передают GPT-5.6 Sol. Один запуск DeepSeek стоит в 35 раз дешевле запуска GPT-5.6 Sol.

Какие операционные различия учитывать при выборе модели?

GPT-5.6 Sol быстрее: медиана 17 минут и 53 шага против 35 минут и 146 шагов у DeepSeek. Но в 20% неудачных запусков GPT-5.6 Sol ломала ранее проходившие тесты против 11% у DeepSeek, поэтому её результаты рекомендуют проверять регрессионными тестами.

Контекст по теме

Как процитировать

«Каскад DeepSeek V4 Pro 0813 и GPT-5.6 Sol достиг 83,0% на DeepSWE». hegai.media, 18 августа 2026 г.. https://hegai.media/novosti/kaskad-deepseek-v4-pro-0813-i-gpt-5-6-sol-dostig-83-0-na-deepswe--62109048-a120-47a7-99b8-d63157b7f79e

так материал выглядит в мессенджере