Почему успешные AI-агенты не доходят до продакшена: проблема оказалась в экономике
Автор системы оценки AI-агентов с 12 метриками рассказал о случае, когда агент для обработки биллинговых и аккаунтных запросов прошёл все внутренние проверки, но в итоге был отключён после финансового ревью. Как пишет Towards Data Science, агент в компании из сегмента mid-market SaaS соответствовал целевым показателям по task completion, faithfulness, retrieval precision, tool-call accuracy, latency и hallucination rate.
Проблема оказалась в другом. По словам автора, ключевым фактором стала стоимость одного успешно закрытого тикета с учётом неудачных попыток агента. В итоге этот показатель оказался выше затрат на полностью человеческий процесс, который система должна была заменить. Руководитель инженерного направления отмечал, что агент работал точнее сотрудников на тех же типах запросов, но для финансового блока это уже не имело значения.
Автор считает, что существующая система метрик была слишком сосредоточена на качестве работы агента и не учитывала окупаемость. По его мнению, в 2026 году одного контроля качества для запуска AI-агентов в production уже недостаточно. Даже если стоимость inference снижается, сами архитектуры становятся сложнее. Один успешный кейс может включать этап планирования, несколько tool calls, дополнительные reasoning passes, self-critique loop и повторные попытки после ошибок инструментов. Из-за этого число токенов на одно успешное действие растёт быстрее, чем падает цена inference.
Ключевые факты
Автор описывает систему оценки AI-агентов из 12 метрик, опубликованную двумя месяцами ранее
В кейсе рассматривался customer-operations агент для обработки billing и account tickets
Система оценки включала task completion, faithfulness, retrieval precision, tool-call accuracy, latency и hallucination rate
По мнению автора, критически важной метрикой для production должна быть стоимость одного успешного результата