Как сообщает Together AI Blog, авторы сравнили GLM-5.3 (max) и GPT-5.6 Sol (max) на всех 113 задачах DeepSWE. Каждую модель проверили по четыре раза на каждой задаче. Всего провели 904 запуска, по 452 на модель.
С одной попытки GPT-5.6 Sol справилась с 72,7% задач, а GLM-5.3 показала результат 69,0%. С двух попыток GLM-5.3 набрала 81,1%, практически сравнявшись с GPT-5.6 Sol, у которой 81,0%. При четырёх попытках результаты составили 87,6% и 85,8% соответственно.
Один запуск GLM-5.3 стоил 3,99 $, GPT-5.6 Sol обходился в 8,37 $. При этом GPT-5.6 Sol в среднем требовались 19 минут и 61 шаг на запуск, а GLM-5.3 тратила 35 минут и 124 шага. Каскадная схема, где сначала запускается GLM-5.3, а при провале тестов задача передаётся GPT-5.6 Sol, решила 85,9% задач. Стоимость составила 6,61 $ за задачу.
Ключевые факты
Сравнение охватило 113 задач DeepSWE и 904 запуска, по 452 для каждой модели.
При одной попытке результат GPT-5.6 Sol составил 72,7%, а GLM-5.3, 69,0%.
Один запуск GLM-5.3 стоил 3,99 $, GPT-5.6 Sol, 8,37 $.
Каскад из двух моделей решил 85,9% задач при стоимости 6,61 $ за задачу.
Вопросы и ответы
- Во сколько обойдётся один запуск каждой модели?
Запуск GLM-5.3 стоил 3,99 $, а GPT-5.6 Sol, 8,37 $, то есть более чем вдвое дороже.
- Когда GPT-5.6 Sol выгоднее, несмотря на результат pass@4?
При одной попытке GPT-5.6 Sol решила 72,7% задач против 69,0% у GLM-5.3. Она также работала быстрее: в среднем 19 минут и 61 шаг против 35 минут и 124 шагов.
- Как снизить стоимость без сильной потери качества?
Каскад сначала запускает GLM-5.3 и только после провала тестов передаёт задачу GPT-5.6 Sol. Такая схема решила 85,9% задач при стоимости 6,61 $ за задачу.