К содержанию
Выпуск №21 · 29 июня 2026 / Новости

AI Gateway добавил поддержку аудио и голосовых агентов в реальном времени

AI Gateway получил поддержку аудио. Появились голос в реальном времени, text-to-speech и speech-to-text.

Редакция 29 июня 2026 г., 20:32 MSK

В Telegram

AI Gateway получил поддержку аудио. Появились голос в реальном времени, text-to-speech и speech-to-text. Работают они через те же API-вызовы, что и запросы для текста, изображений и видео, и проходят через тот же шлюз. Сохраняется общая маршрутизация провайдеров, наблюдаемость, контроль расходов и возможность использовать собственные ключи провайдеров. Как сообщает Vercel (Changelog / News, incl. AI SDK), вместе с запуском добавлена поддержка моделей от OpenAI и xAI. Сами аудиофункции доступны в бета-режиме в AI SDK 7.

Режим realtime позволяет приложению разговаривать с пользователем голосом. Модель получает аудио и сразу отвечает, не дожидаясь завершения всей реплики. Пользователь может перебить модель или говорить поверх её ответа, как в обычной беседе. Это отличается от привычной цепочки speech-to-text, затем языковая модель, затем text-to-speech. В realtime используется одна модель, которая напрямую принимает аудио и сразу генерирует голосовой ответ.

В браузере голосовая сессия запускается через хук useRealtime. Он управляет WebSocket-подключением, захватом микрофона и воспроизведением звука. Подключение проходит через токен с коротким сроком действия, который создаётся на сервере с использованием учётных данных AI Gateway. Благодаря этому API-ключ не передаётся клиенту. Внутри сессии модель может вызывать инструменты прямо по ходу ответа. Момент, когда пользователь закончил говорить, сервер определяет через turnDetection: { type: 'server-vad' }.

Кроме голосового диалога, AI Gateway умеет генерировать речь из текста через generateSpeech и расшифровывать записанное аудио через transcribe. Эти функции можно комбинировать. Например, сначала создать аудио одним вызовом модели, а затем распознать его текст другим. Проверить аудиомодели можно и прямо в браузере, на странице моделей, без написания кода.

Ключевые факты

  • Функции аудио запущены в бета‑режиме и доступны в AI SDK 7.

  • На старте аудио поддерживаются модели от OpenAI и xAI.

Как процитировать

«AI Gateway добавил поддержку аудио и голосовых агентов в реальном времени». hegai.media, 29 июня 2026 г.. https://hegai.media/novosti/ai-gateway-dobavil-podderzhku-audio-i-golosovyh-agentov-v-realnom-vrem--01ebc0ab-f6bc-45a4-b888-f1b0022cfddc

так материал выглядит в мессенджере