К содержанию
Новости

Детектор завершения русской речи сократил паузу голосового ИИ-агента до 316 мс

Инфографика: 316 мс задержка перед ответом
Графика: hegai.media

Как пишет Habr, голосовые платформы определяют конец реплики человека по таймеру тишины. При замере на боевом API общая задержка перед ответом достигла 1275 мс. Из них 1200 мс заняло ожидание таймера, а модель отработала за 75 мс.

Автор предложил детектор, основанный на правилах русского синтаксиса. Он работает без обучения и GPU. Решение сократило задержку с 1200 до 316 мс, при этом число обрывов снизилось с 38 до двух. Методика и результаты замеров описаны как воспроизводимые.

Ключевые факты

  • Из общей задержки 1275 мс на работу модели пришлось 75 мс, а на ожидание таймера, 1200 мс.

  • При использовании решения зафиксировано два обрыва вместо 38.

  • Детектор работает на правилах, без обучения и GPU.

Вопросы и ответы

Что было главным источником задержки до внедрения детектора?

Из общей задержки 1275 мс модель занимала 75 мс, а таймер тишины, 1200 мс. Значит, основная задержка возникала не при генерации ответа, а при ожидании конца реплики.

Ускорение увеличило число преждевременных обрывов речи?

Нет: при использовании детектора зафиксировали два обрыва вместо 38.

Какая инфраструктура нужна для запуска решения?

Детектор основан на правилах русского синтаксиса, поэтому не требует обучения модели и GPU.

Контекст по теме