К содержанию
Выпуск №83 · 30 августа 2026 / Новости

GLM-5.3 Flash выгоднее не вместо GLM-5.3, а перед ним

Flash почти догоняет полную модель после повторных попыток и стоит в 17 раз дешевле за запуск. Но экономия появляется только там, где результат можно проверить тестами и вовремя передать старшей модели.

Редакция 30 августа 2026 г., 09:20 MSK

В Telegram

GLM-5.3 Flash не стоит назначать единственной моделью на весь поток кодинг-агента. Ее сильная позиция другая: дешево сделать первую попытку, проверить результат и вызвать GLM-5.3 только после отказа тестов. В тесте Together AI такой каскад решил 80,9% задач DeepSWE при средней стоимости $1,70 за задачу, тогда как одна GLM-5.3 решила 69,0% за $3,99.

Flash потеряла надежность, а не саму способность решать

Together AI прогнала GLM-5.3 и GLM-5.3 Flash на 113 задачах DeepSWE, по четыре попытки на конфигурацию. Всего получилось 900 запусков. Бенчмарк проверяет программную инженерию на разных типах задач и языках.

С первой попытки полная модель заметно лучше: 69,0% против 63,4%. Но к четвертой попытке разрыв сжимается с 5,6 до 2,6 процентного пункта: 87,6% у GLM-5.3 и 85,0% у Flash.

Это важнее общего места в рейтинге. Из 99 задач, которые полная модель решила хотя бы один раз, Flash смогла решить 93. Ни одна из 48 задач, стабильно решенных GLM-5.3 во всех четырех запусках, не стала для Flash полностью недоступной. Половина осталась столь же стабильной, половина начала решаться через раз.

Иными словами, дистилляция в основном срезала не потолок возможностей, а предсказуемость результата. Для бизнеса это удобный дефект: непредсказуемость можно ловить тестами, а недостающую способность решить задачу уже пришлось бы покупать у другой модели без возможности автоматической диагностики.

Цена одной попытки усиливает этот вывод. Запуск Flash стоит $0,24 против $3,99 у полной версии. На каждые $100 Flash дает 264 решенные задачи, GLM-5.3 только 17. При этом Flash в среднем завершала запуск за 26 минут против 35 минут и делала почти столько же шагов: 123 против 125. Экономия здесь не куплена коротким рассуждением. Меньшая модель просто быстрее проходит каждый шаг.

Маршрутизировать нужно по тестам, а не по ощущению сложности

Самый практичный роутер выглядит почти неприлично просто:

  1. Отправить задачу в GLM-5.3 Flash.
  2. Запустить целевые тесты и полный regression run.
  3. Если хотя бы одна проверка не проходит, передать задачу GLM-5.3 вместе с исходным контекстом и результатами тестов.
  4. Если надежного автоматического проверяющего контура нет, сразу использовать полную модель.

Последний пункт критичен. Flash ломала уже проходивший baseline-тест в 6,9% запусков, полная модель в 4,4%. Поэтому принимать патч по красивому diff или уверенной формулировке агента нельзя. Уверенность модели остается бесплатным жанром художественной литературы, а regression run становится частью экономики маршрутизации.

Не стоит и пытаться заранее размечать задачи как «простые» и «сложные» вручную. Данные Together AI показывают более надежный порог: не описание задачи, а вердикт проверяющего контура. Flash получает шанс там, где ее ошибку можно быстро обнаружить. GLM-5.3 подключается не по должности задачи, а после конкретного отказа тестов.

Есть и ограничение у идеи «дать Flash подумать подольше». На нестабильных задачах более длинный запуск оказывался успешным в 61% случаев у полной модели и только в 46% у Flash. Дополнительное усилие GLM-5.3 чаще превращается в результат, у Flash такой связи нет. Повторные дешевые попытки могут вернуть часть надежности, но удлинять одну попытку и надеяться на прозрение смысла меньше.

Как поставить эксперимент у себя

Контрольная группа должна продолжать отправлять весь поток в GLM-5.3. Экспериментальная группа идет через Flash-first каскад. Сравнивать нужно не средний балл модели, а четыре операционные метрики: долю задач, принятых после Flash, долю эскалаций, итоговый процент прошедших тестов и полную стоимость принятого патча с учетом повторных запусков.

Стартовый порог эскалации я бы зафиксировал жестко: одна попытка Flash, затем тесты, при любом отказе сразу GLM-5.3. Отдельным рукавом можно проверить повторную попытку Flash перед эскалацией, но смешивать две схемы сразу не стоит, иначе средняя стоимость получится красивой, а причина экономии останется неизвестной.

Главный маркер успеха здесь не совпадение с 80,9% из DeepSWE. Смотрите, удерживается ли качество контрольной группы при заметном снижении средней стоимости принятой задачи. Если большинство эскалаций вызывают реальные тестовые отказы, роутер работает. Если инженеры регулярно отменяют принятые Flash-патчи уже после зеленых тестов, проблема не в выборе модели, а в слабом проверяющем контуре.

Как процитировать

«GLM-5.3 Flash выгоднее не вместо GLM-5.3, а перед ним». hegai.media, 30 августа 2026 г.. https://hegai.media/novosti/glm-5-3-flash-vygodnee-ne-vmesto-glm-5-3-a-pered-nim--26f97c8e-2085-49c8-bb82-10626247572a

так материал выглядит в мессенджере