Разработчик Саймон Уиллисон обновил свой экспериментальный инструмент OpenAI WebRTC Audio Session. Теперь во время голосового взаимодействия можно использовать контекст из документов. Первую версию он сделал в December 2024, чтобы попробовать тогда новый OpenAI WebRTC API для работы с realtime audio models.
В прошлом месяце OpenAI представила для этого API модель GPT‑Realtime‑2. Компания описывает её как "our first voice model with GPT‑5‑class reasoning". Для модели указан knowledge cut-off, Sep 30, 2024. Уиллисон рассчитывал увидеть её в приложении ChatGPT iPhone app, но этого пока не случилось, поэтому он решил вернуться к своему старому экспериментальному проекту.
В обновлённой версии можно выбрать эту модель и вставить большой фрагмент текста как document context. После этого пользователь ведёт аудиодиалог прямо в браузере и обсуждает информацию из добавленного документа.
Ключевые факты
Первая версия инструмента была создана в декабре 2024 года для тестирования OpenAI WebRTC API для работы с моделями аудио в реальном времени.
В API OpenAI был добавлен модельный вариант GPT‑Realtime‑2, который описывается как «our first voice model with GPT‑5‑class reasoning».
Для GPT‑Realtime‑2 указан knowledge cut-off: Sep 30, 2024.
В обновлённой версии инструмента можно выбрать новую модель и вставить большой фрагмент документа, чтобы обсуждать его в аудиодиалоге прямо в браузере.