По данным Together AI Blog, GLM-5.3 и GLM-5.3 Flash сравнили на всех 113 задачах DeepSWE. Каждую конфигурацию испытывали по четыре раза. Всего провели 900 запусков: 452 для полной модели и 448 для Flash. С первой попытки GLM-5.3 решила 69,0% задач, Flash справилась с 63,4%. К четвёртой попытке разрыв сократился до 2,6 пункта: результаты составили 87,6% и 85,0% соответственно.
Один запуск Flash стоил 0,24 $, а полной модели 3,99 $, в 17 раз дороже. На каждые потраченные 100 $ Flash решала 264 задачи, GLM-5.3 только 17. Полная модель хотя бы с одной попытки решила 99 задач. Flash справилась с 93 из них, то есть с 94%.
Авторы Together AI Blog также проверили каскадную схему. Сначала запускали Flash, а если тесты отклоняли ответ, задачу передавали полной модели. Такой подход позволил решить 80,9% задач при средней стоимости обработки 1,70 $ за задачу. В эту сумму вошли 0,24 $ за обязательный запуск Flash и 3,99 $ за запуск полной модели для 36,6% задач, с которыми Flash не справилась с первой попытки.
Для сравнения, GLM-5.3 при самостоятельном запуске с первой попытки решила 69,0% задач, а обработка каждой стоила 3,99 $. Однако Flash чаще ломала уже проходивший базовый тест. Регрессии возникали в 6,9% запусков против 4,4% у полной модели, поэтому авторы рекомендуют добавить проверку на регрессии.
Ключевые факты
Сравнение охватило 113 задач, по четыре испытания на конфигурацию и 900 запусков всего.
С первой попытки GLM-5.3 решила 69,0% задач, а GLM-5.3 Flash, 63,4%; к четвёртой попытке показатели достигли 87,6% и 85,0%.
Один запуск GLM-5.3 Flash стоил 0,24 $, а полной GLM-5.3, 3,99 $, что соответствует разнице в 17 раз.
GLM-5.3 Flash ломала уже проходивший базовый тест в 6,9% запусков против 4,4% у полной модели.
Вопросы и ответы
- Как устроен каскад и когда подключается полная модель?
Сначала задачу выполняет GLM-5.3 Flash за 0,24 $, а GLM-5.3 запускается только при отклонении ответа тестами. Для сравнения, отдельный запуск полной модели стоит 3,99 $, в 17 раз дороже.
- Насколько Flash уступает полной модели по качеству?
С первой попытки Flash решила 63,4% задач против 69,0% у GLM-5.3, а к четвёртой попытке разрыв сократился до 2,6 пункта: 85,0% против 87,6%. Flash также справилась с 93 из 99 задач, которые хотя бы раз решила полная модель.
- Какой дополнительный контроль нужен при внедрении?
Нужна проверка на регрессии: Flash ломала уже проходивший базовый тест в 6,9% запусков против 4,4% у полной GLM-5.3.
Контекст по теме
- Каскад DeepSeek V4 Pro 0813 и Claude Fable 5 достиг 82,7% на DeepSWE18 августа 2026 г.
- Каскад DeepSeek V4 Pro 0813 и GPT-5.6 Sol достиг 83,0% на DeepSWE18 августа 2026 г.
- GLM-5.2 в 4‑битной квантизации запустили на кластере из 4 DGX Spark с контекстом 128K29 июня 2026 г.
- Энтузиаст показал конфигурацию до 2500 $ для запуска GLM5.2 на локальном железе28 июня 2026 г.