Как сообщается в Together AI Blog, модели GLM-5.3 (max) и Claude Fable 5 (max) проверили на всех 113 задачах DeepSWE в четырех испытаниях. Всего провели 904 запуска, по 452 для каждой модели. С первой попытки Claude Fable 5 решила 69,7% задач, а GLM-5.3 справилась с 69,0%. Разница в 0,7 процентного пункта уложилась в пределы погрешности.
При двух попытках вперед вышла GLM-5.3 с результатом 81,1% против 77,1% у Claude Fable 5. При четырех попытках показатели выросли до 87,6% и 84,1% соответственно.
Разница в стоимости оказалась заметнее. Один запуск GLM-5.3 стоил 3,99 $, запуск Claude Fable 5 обходился в 21,63 $, то есть в 5,4 раза дороже. На каждые 100 $ GLM-5.3 решала 17 задач, а Claude Fable 5 только 3. При этом среднее время запуска почти не различалось: 35 минут у GLM-5.3 и 34 минуты у Claude Fable 5.
При сопоставимых результатах с первой попытки GLM-5.3 лучше показала себя при повторных запусках и стоила заметно дешевле. Авторы предлагают использовать ее как основную модель, а Claude Fable 5 подключать для задач на Rust и сериализацию.
Ключевые факты
Тест включал 904 запуска: по 452 для каждой модели.
С первой попытки GLM-5.3 решила 69,0% задач, а Claude Fable 5, 69,7%.
Один запуск GLM-5.3 стоил 3,99 $, Claude Fable 5, 21,63 $.
Среднее время запуска составило 35 минут у GLM-5.3 и 34 минуты у Claude Fable 5.
Вопросы и ответы
- Насколько GLM-5.3 дешевле в эксплуатации?
Один запуск стоил 3,99 $ против 21,63 $ у Claude Fable 5. При бюджете 100 $ GLM-5.3 решала 17 задач, а Claude Fable 5, только 3.
- Как распределить модели в рабочем процессе?
Авторы предлагают использовать GLM-5.3 как основную более дешёвую модель, а Claude Fable 5 подключать для задач на Rust и сериализацию.
- Придётся ли жертвовать скоростью ради экономии?
Практически нет: средний запуск GLM-5.3 занимал 35 минут, Claude Fable 5, 34 минуты. При этом GLM-5.3 использовала 80 тыс. выходных токенов против 114 тыс.