Как сообщает Together AI Blog, DeepSeek V4 Pro 0813 и Claude Fable 5 сравнили на всех 113 задачах бенчмарка DeepSWE. Он проверяет навыки программной инженерии на разных типах задач и языках программирования. Каждая модель получила по четыре попытки на задачу. Всего провели 904 запуска, по 452 для каждой модели.
С первой попытки Claude Fable 5 решила 69,7% задач, а DeepSeek V4 Pro 0813 справилась с 62,8%. После двух попыток результат Pro вырос до 78,5%, у Fable он составил 77,1%. После четырёх попыток показатели достигли 88,5% и 84,1% соответственно. При этом один запуск Pro стоил 0,24 $, а Fable обходился в 21,63 $, то есть в 90 раз дороже.
Авторы также протестировали каскадную схему. Сначала задачу получает DeepSeek V4 Pro 0813, а в случае неудачи её передают Claude Fable 5. Такой маршрут справился с 82,7% задач при затратах 8,28 $ на задачу. Для сравнения, Fable отдельно показала результат 69,7% при стоимости 21,63 $.
По оценке авторов, маршрутизация работает благодаря тому, что модели ошибаются по-разному. Корреляция их результатов по задачам составила 0,39, а вместе они покрыли 107 из 113 задач.
Ключевые факты
В сравнении провели 904 запуска на 113 задачах, по четыре испытания каждой модели на задачу.
С первой попытки Claude Fable 5 решила 69,7% задач, а DeepSeek V4 Pro 0813, 62,8%.
Один запуск DeepSeek V4 Pro 0813 стоил 0,24 $, Claude Fable 5, 21,63 $.
После четырёх попыток DeepSeek V4 Pro 0813 достигла 88,5%, а Claude Fable 5, 84,1%.
Вопросы и ответы
- Сколько каскад экономит по сравнению с использованием только Claude?
Затраты составили 8,28 $ на задачу против 21,63 $ у Claude Fable 5 отдельно. При этом каскад решил 82,7% задач, а Claude с первой попытки, 69,7%.
- Как устроена маршрутизация между моделями?
Сначала задачу получает DeepSeek V4 Pro 0813, и только при неудаче она передаётся Claude Fable 5. Такой подход работает за счёт разных ошибок моделей: корреляция результатов составила 0,39, вместе они покрыли 107 из 113 задач.
- Сохраняется ли преимущество Claude при повторных попытках?
Нет: с первой попытки Claude решила 69,7% задач против 62,8% у DeepSeek, но после четырёх попыток DeepSeek достигла 88,5% против 84,1% у Claude. Один запуск при этом стоил 0,24 $ и 21,63 $ соответственно.
Контекст по теме
- Каскад DeepSeek V4 Pro 0813 и GPT-5.6 Sol достиг 83,0% на DeepSWE18 августа 2026 г.
- DeepSeek выпустила официальную версию V4 Pro и обновила API16 августа 2026 г.
- DeepSeek привлек более 50 млрд юаней и начал масштабное расширение команды27 июня 2026 г.
- Anthropic представила модели Claude Fable 5 и Claude Mythos 510 июня 2026 г.