GLM-5.3 Flash не стоит назначать единственной моделью на весь поток кодинг-агента. Ее сильная позиция другая: дешево сделать первую попытку, проверить результат и вызвать GLM-5.3 только после отказа тестов. В тесте Together AI такой каскад решил 80,9% задач DeepSWE при средней стоимости $1,70 за задачу, тогда как одна GLM-5.3 решила 69,0% за $3,99.
Flash потеряла надежность, а не саму способность решать
Together AI прогнала GLM-5.3 и GLM-5.3 Flash на 113 задачах DeepSWE, по четыре попытки на конфигурацию. Всего получилось 900 запусков. Бенчмарк проверяет программную инженерию на разных типах задач и языках.
С первой попытки полная модель заметно лучше: 69,0% против 63,4%. Но к четвертой попытке разрыв сжимается с 5,6 до 2,6 процентного пункта: 87,6% у GLM-5.3 и 85,0% у Flash.
Это важнее общего места в рейтинге. Из 99 задач, которые полная модель решила хотя бы один раз, Flash смогла решить 93. Ни одна из 48 задач, стабильно решенных GLM-5.3 во всех четырех запусках, не стала для Flash полностью недоступной. Половина осталась столь же стабильной, половина начала решаться через раз.
Иными словами, дистилляция в основном срезала не потолок возможностей, а предсказуемость результата. Для бизнеса это удобный дефект: непредсказуемость можно ловить тестами, а недостающую способность решить задачу уже пришлось бы покупать у другой модели без возможности автоматической диагностики.
Цена одной попытки усиливает этот вывод. Запуск Flash стоит $0,24 против $3,99 у полной версии. На каждые $100 Flash дает 264 решенные задачи, GLM-5.3 только 17. При этом Flash в среднем завершала запуск за 26 минут против 35 минут и делала почти столько же шагов: 123 против 125. Экономия здесь не куплена коротким рассуждением. Меньшая модель просто быстрее проходит каждый шаг.
Маршрутизировать нужно по тестам, а не по ощущению сложности
Самый практичный роутер выглядит почти неприлично просто:
- Отправить задачу в GLM-5.3 Flash.
- Запустить целевые тесты и полный regression run.
- Если хотя бы одна проверка не проходит, передать задачу GLM-5.3 вместе с исходным контекстом и результатами тестов.
- Если надежного автоматического проверяющего контура нет, сразу использовать полную модель.
Последний пункт критичен. Flash ломала уже проходивший baseline-тест в 6,9% запусков, полная модель в 4,4%. Поэтому принимать патч по красивому diff или уверенной формулировке агента нельзя. Уверенность модели остается бесплатным жанром художественной литературы, а regression run становится частью экономики маршрутизации.
Не стоит и пытаться заранее размечать задачи как «простые» и «сложные» вручную. Данные Together AI показывают более надежный порог: не описание задачи, а вердикт проверяющего контура. Flash получает шанс там, где ее ошибку можно быстро обнаружить. GLM-5.3 подключается не по должности задачи, а после конкретного отказа тестов.
Есть и ограничение у идеи «дать Flash подумать подольше». На нестабильных задачах более длинный запуск оказывался успешным в 61% случаев у полной модели и только в 46% у Flash. Дополнительное усилие GLM-5.3 чаще превращается в результат, у Flash такой связи нет. Повторные дешевые попытки могут вернуть часть надежности, но удлинять одну попытку и надеяться на прозрение смысла меньше.
Как поставить эксперимент у себя
Контрольная группа должна продолжать отправлять весь поток в GLM-5.3. Экспериментальная группа идет через Flash-first каскад. Сравнивать нужно не средний балл модели, а четыре операционные метрики: долю задач, принятых после Flash, долю эскалаций, итоговый процент прошедших тестов и полную стоимость принятого патча с учетом повторных запусков.
Стартовый порог эскалации я бы зафиксировал жестко: одна попытка Flash, затем тесты, при любом отказе сразу GLM-5.3. Отдельным рукавом можно проверить повторную попытку Flash перед эскалацией, но смешивать две схемы сразу не стоит, иначе средняя стоимость получится красивой, а причина экономии останется неизвестной.
Главный маркер успеха здесь не совпадение с 80,9% из DeepSWE. Смотрите, удерживается ли качество контрольной группы при заметном снижении средней стоимости принятой задачи. Если большинство эскалаций вызывают реальные тестовые отказы, роутер работает. Если инженеры регулярно отменяют принятые Flash-патчи уже после зеленых тестов, проблема не в выборе модели, а в слабом проверяющем контуре.