К содержанию
Выпуск №82 · 29 августа 2026 / Новости

Каскад GLM-5.3 решил 80,9% задач DeepSWE

По данным Together AI Blog, GLM-5.3 и GLM-5.3 Flash сравнили на всех 113 задачах DeepSWE. Каждую конфигурацию испытывали по четыре раза.

Редакция 29 августа 2026 г., 04:59 MSK

В Telegram

По данным Together AI Blog, GLM-5.3 и GLM-5.3 Flash сравнили на всех 113 задачах DeepSWE. Каждую конфигурацию испытывали по четыре раза. Всего провели 900 запусков: 452 для полной модели и 448 для Flash. С первой попытки GLM-5.3 решила 69,0% задач, Flash справилась с 63,4%. К четвёртой попытке разрыв сократился до 2,6 пункта: результаты составили 87,6% и 85,0% соответственно.

Один запуск Flash стоил 0,24 $, а полной модели 3,99 $, в 17 раз дороже. На каждые потраченные 100 $ Flash решала 264 задачи, GLM-5.3 только 17. Полная модель хотя бы с одной попытки решила 99 задач. Flash справилась с 93 из них, то есть с 94%.

Авторы Together AI Blog также проверили каскадную схему. Сначала запускали Flash, а если тесты отклоняли ответ, задачу передавали полной модели. Такой подход позволил решить 80,9% задач при средней стоимости обработки 1,70 $ за задачу. В эту сумму вошли 0,24 $ за обязательный запуск Flash и 3,99 $ за запуск полной модели для 36,6% задач, с которыми Flash не справилась с первой попытки.

Для сравнения, GLM-5.3 при самостоятельном запуске с первой попытки решила 69,0% задач, а обработка каждой стоила 3,99 $. Однако Flash чаще ломала уже проходивший базовый тест. Регрессии возникали в 6,9% запусков против 4,4% у полной модели, поэтому авторы рекомендуют добавить проверку на регрессии.

Ключевые факты

  • Сравнение охватило 113 задач, по четыре испытания на конфигурацию и 900 запусков всего.

  • С первой попытки GLM-5.3 решила 69,0% задач, а GLM-5.3 Flash, 63,4%; к четвёртой попытке показатели достигли 87,6% и 85,0%.

  • Один запуск GLM-5.3 Flash стоил 0,24 $, а полной GLM-5.3, 3,99 $, что соответствует разнице в 17 раз.

  • GLM-5.3 Flash ломала уже проходивший базовый тест в 6,9% запусков против 4,4% у полной модели.

Вопросы и ответы

Как устроен каскад и когда подключается полная модель?

Сначала задачу выполняет GLM-5.3 Flash за 0,24 $, а GLM-5.3 запускается только при отклонении ответа тестами. Для сравнения, отдельный запуск полной модели стоит 3,99 $, в 17 раз дороже.

Насколько Flash уступает полной модели по качеству?

С первой попытки Flash решила 63,4% задач против 69,0% у GLM-5.3, а к четвёртой попытке разрыв сократился до 2,6 пункта: 85,0% против 87,6%. Flash также справилась с 93 из 99 задач, которые хотя бы раз решила полная модель.

Какой дополнительный контроль нужен при внедрении?

Нужна проверка на регрессии: Flash ломала уже проходивший базовый тест в 6,9% запусков против 4,4% у полной GLM-5.3.

Контекст по теме

Как процитировать

«Каскад GLM-5.3 решил 80,9% задач DeepSWE». hegai.media, 29 августа 2026 г.. https://hegai.media/novosti/kaskad-glm-5-3-reshil-80-9-zadach-deepswe--5e2d8f4d-388c-4d61-bd7e-a288cea94454

так материал выглядит в мессенджере