К содержанию
Выпуск №71 · 18 августа 2026 / Новости

Каскад DeepSeek V4 Pro 0813 и Claude Fable 5 достиг 82,7% на DeepSWE

Он проверяет навыки программной инженерии на разных типах задач и языках программирования. Каждая модель получила по четыре попытки на задачу.

Редакция 18 августа 2026 г., 12:34 MSK

В Telegram

Как сообщает Together AI Blog, DeepSeek V4 Pro 0813 и Claude Fable 5 сравнили на всех 113 задачах бенчмарка DeepSWE. Он проверяет навыки программной инженерии на разных типах задач и языках программирования. Каждая модель получила по четыре попытки на задачу. Всего провели 904 запуска, по 452 для каждой модели.

С первой попытки Claude Fable 5 решила 69,7% задач, а DeepSeek V4 Pro 0813 справилась с 62,8%. После двух попыток результат Pro вырос до 78,5%, у Fable он составил 77,1%. После четырёх попыток показатели достигли 88,5% и 84,1% соответственно. При этом один запуск Pro стоил 0,24 $, а Fable обходился в 21,63 $, то есть в 90 раз дороже.

Авторы также протестировали каскадную схему. Сначала задачу получает DeepSeek V4 Pro 0813, а в случае неудачи её передают Claude Fable 5. Такой маршрут справился с 82,7% задач при затратах 8,28 $ на задачу. Для сравнения, Fable отдельно показала результат 69,7% при стоимости 21,63 $.

По оценке авторов, маршрутизация работает благодаря тому, что модели ошибаются по-разному. Корреляция их результатов по задачам составила 0,39, а вместе они покрыли 107 из 113 задач.

Ключевые факты

  • В сравнении провели 904 запуска на 113 задачах, по четыре испытания каждой модели на задачу.

  • С первой попытки Claude Fable 5 решила 69,7% задач, а DeepSeek V4 Pro 0813, 62,8%.

  • Один запуск DeepSeek V4 Pro 0813 стоил 0,24 $, Claude Fable 5, 21,63 $.

  • После четырёх попыток DeepSeek V4 Pro 0813 достигла 88,5%, а Claude Fable 5, 84,1%.

Вопросы и ответы

Сколько каскад экономит по сравнению с использованием только Claude?

Затраты составили 8,28 $ на задачу против 21,63 $ у Claude Fable 5 отдельно. При этом каскад решил 82,7% задач, а Claude с первой попытки, 69,7%.

Как устроена маршрутизация между моделями?

Сначала задачу получает DeepSeek V4 Pro 0813, и только при неудаче она передаётся Claude Fable 5. Такой подход работает за счёт разных ошибок моделей: корреляция результатов составила 0,39, вместе они покрыли 107 из 113 задач.

Сохраняется ли преимущество Claude при повторных попытках?

Нет: с первой попытки Claude решила 69,7% задач против 62,8% у DeepSeek, но после четырёх попыток DeepSeek достигла 88,5% против 84,1% у Claude. Один запуск при этом стоил 0,24 $ и 21,63 $ соответственно.

Контекст по теме

Как процитировать

«Каскад DeepSeek V4 Pro 0813 и Claude Fable 5 достиг 82,7% на DeepSWE». hegai.media, 18 августа 2026 г.. https://hegai.media/novosti/kaskad-deepseek-v4-pro-0813-i-claude-fable-5-dostig-82-7-na-deepswe--2568cc28-468b-4921-9e62-e8d040a3ce48

так материал выглядит в мессенджере