К содержанию
Выпуск №100 · 16 сентября 2026 / Новости

Gemini 3.8 Live отделяет разговор от работы: агенту больше не нужно молчать во время API-вызова

Новые голосовые модели Google продолжают диалог, пока инструменты выполняют задачу в фоне. Для продаж и поддержки это шанс убрать неловкие паузы, но экономику длинных сессий ещё придётся проверять самостоятельно.

Редакция 16 сентября 2026 г., 15:35 MSK

В Telegram

Google DeepMind представила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Главное здесь не очередное обещание «более естественного» голоса, а новая архитектура взаимодействия: модель может продолжать разговор, одновременно вызывая API и выполняя многошаговую задачу в фоне.

Если голосовой агент построен как цепочка «услышал, подумал, сходил в систему, ответил», любой медленный инструмент превращается в паузу. Gemini 3.8 Live предлагает разделить эти процессы. Агент подтверждает запрос, поддерживает диалог и сообщает о ходе работы, пока функция завершается асинхронно.

Два режима под разные задачи

В блоге Google DeepMind модель Gemini 3.8 Live описана как вариант для масштаба и экономичной работы. Она поддерживает визуальный контекст почти в реальном времени, автоматически определяет язык и может переключаться между 97 языками внутри одного разговора.

Gemini 3.8 Live Extended Thinking предназначена для более сложных сценариев и многошаговых рассуждений. Модель может рассуждать и говорить одновременно: например, сначала сказать «сейчас проверю», а затем комментировать выполнение фоновой задачи. Google показывает среди примеров координацию нескольких бронирований, асинхронные вызовы функций и превращение набросков с голосовыми комментариями в React-компоненты.

Обе модели доступны разработчикам через Gemini API и Google AI Studio. Интеграцию также поддерживают Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents, которые берут на себя инфраструктуру потоковой передачи аудио и видео.

Google подкрепляет релиз бенчмарками. Extended Thinking получила 82,6 балла в Speech to Speech Quality Index от Artificial Analysis, 68,6% на τ-Voice, 35,1% на банковском тесте Sierra τ-Voice и 97,7% на Big Bench Audio. Обычная Gemini 3.8 Live заняла второе место в Speech Agent Arena. Это аргументы в пользу пилота, но ещё не доказательство экономики продакшена.

Что проверять бизнесу

Для голосовых продаж, поддержки и внутренних ассистентов выигрыш понятен: паузу во время обращения к CRM, календарю или другому инструменту можно заполнить нормальным разговором, а визуальный контекст добавить в тот же сеанс. Особенно интересен не голос сам по себе, а возможность не блокировать интерфейс на время исполнения.

Но в анонсе нет точных цен для длинных голосовых сессий, данных о частоте ошибок фоновых действий и показателей задержки в конкретных интеграциях. Поэтому миграцию разумно начинать не с оценки тембра, а с трёх замеров: сколько длится пауза до первого ответа, как часто успешно завершается вызов инструмента и во сколько обходится законченная задача. Если параллельный диалог улучшает разговор, но повышает число незаметных ошибок в фоне, красивый голос окажется просто дорогой музыкой ожидания.

Как процитировать

«Gemini 3.8 Live отделяет разговор от работы: агенту больше не нужно молчать во время API-вызова». hegai.media, 16 сентября 2026 г.. https://hegai.media/novosti/gemini-3-8-live-otdelyaet-razgovor-ot-raboty-agentu-bolshe-ne-nuzhno-m--f772e430-53f6-42f7-9ca5-1edeb9b71277

так материал выглядит в мессенджере