К содержанию
Выпуск №73 · 20 августа 2026 / Новости

Цена минуты voice-агента ничего не доказывает: бизнес платит за решённое обращение

Тариф выглядит выгодно, пока в него не попали паузы, повторы, растущий контекст, неудачные звонки и передача оператору. Сравнивать voice-агента с человеком можно только по полной стоимости успешно завершённой задачи.

Редакция 19 августа 2026 г., 01:19 MSK

В Telegram

Цена минуты voice-агента удобна продавцу и почти бесполезна покупателю. Она не отвечает на главный вопрос бизнеса: сколько стоит обращение, которое система действительно довела до результата, а не просто обслуживала какое-то время.

Свежий разбор TNW показывает, почему коммерческое предложение с красивой ставкой за минуту легко создаёт ложную экономию. В production оплачивается не одна «минута ИИ», а несколько разных процессов, причём каждый считает нагрузку по-своему.

Одна беседа, пять разных счетчиков

TNW выделяет пять основных слоёв voice-стека. Speech-to-text обычно тарифицирует аудиоминуты. LLM считает токены. Text-to-speech может брать плату за символы, токены или объём сгенерированной речи. Телефония зависит от времени соединения, типа звонка и направления. Инфраструктура добавляет медиасерверы, оркестрацию, вычисления, логирование и мониторинг.

Поэтому ставка вроде 0,05 доллара за минуту ничего не объясняет, пока неизвестно, что именно в неё входит.

TNW приводит пример 35-минутного интервью: собеседник говорит 20 минут, агент 12, остальное занимают паузы, перебивания и переходы между репликами. STT в основном видит речь участника, TTS считает речь агента, а телефония и инфраструктура могут тарифицировать все 35 минут соединения.

У модели своя экономика. К поздним репликам она может повторно обрабатывать инструкции, предыдущий диалог и результаты вызова инструментов. Поэтому ответ в двадцатом ходе способен стоить дороже такого же по длине ответа в начале разговора. Контекст можно сокращать, суммировать и кэшировать, но слишком агрессивная чистка повышает риск, что агент забудет важную деталь.

Это означает, что длительность звонка лишь задаёт нижнюю рамку расходов. Реальную цену определяет траектория разговора.

Латентность становится статьёй расходов

Медленный агент не просто раздражает. По наблюдению автора TNW, задержка заставляет людей повторять сказанное или начинать новую фразу. Возникает ещё один ход модели, растёт время соединения и добавляется обработка.

Перебивания работают похожим образом. Пользователь начинает говорить, система останавливает ответ, но TTS уже мог сгенерировать аудио, которое никто не услышит. Пауза тоже не бесплатна: распознавание может не учитывать каждую секунду тишины, однако телефония и инфраструктура продолжают считать открытое соединение.

Отсюда неприятный для закупки вывод: более дорогая быстрая модель или качественное распознавание иногда обходятся дешевле бюджетного компонента. Особенно в неанглоязычном сценарии, где, как пишет TNW, ошибка распознавания может вызвать дополнительный ответ, новый ход модели и удлинение звонка. Экономить нужно не внутри прайс-листа, а на всей цепочке разговора.

Считать нужно исход, а не попытку

В примере TNW системе требуется 108 попыток, чтобы получить 100 успешных результатов. Восемь неудач уже успели потратить транскрибацию, токены модели, синтез речи, телефонию и инфраструктуру. Если пользователь звонит повторно, цикл оплаты запускается заново. Причём провал на 34-й минуте дороже провала на первой.

Рабочая формула выглядит так:

Стоимость успешного исхода = voice-стек + неудачи и повторы + работа человека + оценка и эксплуатация, делённые на число успешных исходов.

Для пилота это меняет саму таблицу расчёта. Рядом с минутным тарифом должны появиться средняя длительность соединения, число ходов модели, доля повторных попыток, момент отказа и объём ручной обработки после передачи человеку. Без этих строк сравнение с оператором остаётся презентацией, а не экономикой.

Если сценарий регулярно заканчивается несколькими минутами ручной доработки, экономия половины цента на TTS почти не влияет на бизнес-кейс. Наблюдаемость и оценка качества тоже стоят денег: нужно замечать рост задержки, сбои инструментов и неработающую передачу человеку, а затем проверять, достиг ли разговор нужного результата.

Managed-платформа прячет часть этих расходов в минутной ставке. Собственный стек может снизить переменные API-затраты, но переносит на команду оркестрацию, масштабирование, интеграции и восстановление после сбоев. Выигрывает не тот, кто нашёл самый дешёвый компонент, а тот, кто сократил число лишних ходов и дорогих неудач.

Практический предел автоматизации поэтому задаётся не магической длительностью звонка. Агент дешевле человека только там, где он стабильно завершает задачу без повторов и длинной эскалации. Проверять прогноз стоит по трём показателям после пилота: стоимости успешного исхода, доле обращений без повторной попытки и времени ручной обработки. Если они не улучшаются вместе, низкая цена минуты просто аккуратно маскирует дорогой процесс.

Как процитировать

«Цена минуты voice-агента ничего не доказывает: бизнес платит за решённое обращение». hegai.media, 19 августа 2026 г.. https://hegai.media/novosti/tsena-minuty-voice-agenta-nichego-ne-dokazyvaet-biznes-platit-za-reshe--c46c5e30-a2ca-4488-bca3-7b0636302fd9

так материал выглядит в мессенджере