К содержанию
Выпуск №71 · 18 августа 2026 / Новости

Дорогая модель больше не страхует качество payroll-агента: нужен собственный eval

Rippling прогнала 15 моделей примерно по 2100 раз на реальных операциях с персоналом и выплатами. Разница в качестве наверху сжалась до нескольких пунктов, а в цене осталась кратной, поэтому закупку инференса пора начинать не с бренда, а со своего набора задач.

Редакция 18 августа 2026 г., 21:21 MSK

В Telegram

Rippling проверила 15 AI-моделей на реальных данных и операциях своей payroll-системы. Самая дорогая модель не стала лучшей, а одна из дешёвых практически сравнялась с ней по доле успешно выполненных задач. Для команд, которые строят агентов с проверяемым результатом, вывод прикладной: контракт с провайдером стоит подписывать только после собственного eval.

Что именно проверяла Rippling

Как пишет SaaStrAI, на каждую модель пришлось около 2100 оценённых попыток. Агенты отвечали на вопросы о численности сотрудников и распределении по стажу, повышали зарплаты людям по заданному условию, проводили нового сотрудника по чек-листу, планировали увольнение с согласованиями и переносили суммы из таблицы в payroll-запуск.

Проверка была бинарной: операция либо прошла production-контроль Rippling, либо нет. Частичных баллов не давали, а незавершённая попытка считалась провалом. Кроме pass rate компания смотрела стоимость полного набора тестов и время выполнения у самых медленных 10% запусков. Последняя метрика особенно полезна для продукта: клиент обычно запоминает не среднюю скорость, а тот случай, когда агент задумался на четыре минуты.

Лучший результат показала Opus 4.6: 91% успешных попыток при стоимости $1453 и 154 секундах у самых медленных 10% задач. GPT-5.5 med набрала 89,5% за $1435, а GPT-5.5 low дала 88,8% за $1308 и сократила медленный хвост до 130 секунд.

Но самый показательный вариант для закупщика инференса здесь GLM 5.2: 88,7% за $621. По качеству это практически уровень GPT-5.5 low, но модель заметно медленнее: 243 секунды в медленном хвосте. Для интерактивного интерфейса такая задержка может быть неприемлемой. Для ночного пересчёта, бэкфила или обогащения данных это уже не дефект, а скидка.

На другом конце прайс-листа Fable 5 сравнялась по качеству с GPT-5.5 low, но стоила в 3,3 раза дороже и работала вдвое дольше. Opus 5 уступила Grok 4.5 одновременно по цене и скорости, опередив её по качеству лишь на 0,2 пункта. По данным SaaStrAI, семь моделей уложились в диапазон от 88,5% до 89,5%, хотя стоимость отдельных почти одинаковых по результату вариантов различалась в семь раз.

Бенчмарк здесь не ответ, а шаблон процедуры

Этот результат не доказывает, что дешёвая модель вообще не хуже дорогой. Он показывает более неприятную для отделов закупки вещь: цена и свежесть релиза не предсказывают качество на конкретной бизнес-операции.

Граница исследования важна. Rippling пять месяцев настраивала инструкции и инструменты под Opus 4.6. По оценке президента и CPO компании Мэтта Макинниса, эта работа могла добавить один-два пункта точности. Остальные модели запускались без такой настройки, поэтому их результаты скорее нижняя граница, чем окончательный потолок. При этом весь разрыв между лидером и плотной группой конкурентов составил 2,5 пункта. Получается, собственные инструкции и тесты могут стоить примерно столько же, сколько очередное поколение модели.

Архитектуру Rippling намеренно оставила простой: одна модель, без роутинга, с двумя универсальными инструментами. Это делает сравнение полезным, но не универсальным. Если ваш агент пользуется другим набором инструментов, получает иные документы или работает под более жёстким лимитом задержки, победитель может поменяться.

Есть и ещё одна ловушка. Макиннис повторно прогнал тесты на Grok 4.6 и получил 85,9% против 87,3% у Grok 4.5, а типичное время ответа выросло с 71 до 131 секунды. Но показатель Grok 4.5 из другого запуска не совпал с 89,1% в опубликованной таблице. Поэтому сравнивать модель с результатом прошлого квартала нельзя: кандидатов нужно запускать в одном и том же цикле на одном наборе данных.

Что менять в закупке

Практическая схема выглядит так: собрать собственные проверяемые операции, считать незавершённые действия ошибками, отдельно измерять pass rate, стоимость и медленный хвост, а затем одновременно прогонять несколько моделей. После этого выбирать не «лучшую вообще», а подходящую под режим задачи. Быстрая модель может обслуживать интерфейс, медленная и дешёвая выполнять фоновые операции, а дорогая оставаться только там, где дополнительный пункт точности действительно окупается.

Rippling уже столкнулась с неконтролируемыми расходами на AI и, по данным TechCrunch, выпустила AI Spend Console для учёта затрат сотрудников и команд. Новый тест продолжает ту же логику: расходы на модели перестают быть строкой, которую оправдывает громкое имя поставщика, и становятся измеряемой производственной себестоимостью.

Маркер для следующего решения простой. Когда провайдер выпустит новую версию, не обновляйте агента автоматически. Прогоните старую, новую и дешёвую альтернативу в одном eval. Если новая модель не улучшит ваш pass rate или медленный хвост настолько, чтобы покрыть разницу в цене, номер версии можно оставить отделу маркетинга.

Как процитировать

«Дорогая модель больше не страхует качество payroll-агента: нужен собственный eval». hegai.media, 18 августа 2026 г.. https://hegai.media/novosti/dorogaya-model-bolshe-ne-strahuet-kachestvo-payroll-agenta-nuzhen-sobs--d8f09712-0c27-44db-88ca-0724bccdec53

так материал выглядит в мессенджере