OpenAI выпустила модели GPT-Live-Transcribe и GPT-Transcribe для распознавания речи

OpenAI выпустила две модели для транскрибации речи через API: GPT-Live-Transcribe и GPT-Transcribe. Как сообщает IT Home, первая рассчитана на потоковое распознавание речи в реальном времени с низкой задержкой, вторая подходит для асинхронной обработки готовых аудиофайлов и пакетных задач.
GPT-Live-Transcribe стоит 0,017 $ за минуту транскрибации, GPT-Transcribe, 0,0045 $ за минуту. В OpenAI говорят, что новые модели лучше учитывают контекст по сравнению с предыдущими решениями компании и точнее работают с реальными аудиозаписями. Речь идет в том числе о разных акцентах, числах, специализированных терминах и записи с громким фоновым шумом.
В тесте Context Aware ASR модель GPT-Transcribe повысила семантическую точность с 41,6% без свободного контекста до 45,2% при его наличии. На наборе Common Voice для 22 языков уровень ошибок транскрибации у GPT-Transcribe составил 19,27%, тогда как у Whisper (whisper-1) этот показатель достиг 40,37%. В бенчмарке реальных аудиозаписей на девяти языках уровень ошибок составил 8,98% против 15,21% у Whisper (whisper-1).
Ключевые факты
GPT-Live-Transcribe стоит 0,017 $ за минуту транскрибации
GPT-Transcribe стоит 0,0045 $ за минуту транскрибации
В тесте Context Aware ASR семантическая точность GPT-Transcribe выросла с 41,6% до 45,2% при использовании контекста
На Common Voice для 22 языков уровень ошибок GPT-Transcribe составил 19,27% против 40,37% у Whisper (whisper-1)
Вопросы и ответы
- Какую модель выбирать для звонков и онлайн-диалогов, а какую для обработки архива аудио?
GPT-Live-Transcribe рассчитана на потоковое распознавание с низкой задержкой в реальном времени и стоит 0,017 $ за минуту. GPT-Transcribe предназначена для асинхронной обработки готовых файлов и пакетных задач, цена ниже: 0,0045 $ за минуту.
- Насколько новые модели точнее Whisper на практике?
На наборе Common Voice для 22 языков GPT-Transcribe показала уровень ошибок 19,27% против 40,37% у whisper-1. В тесте реальных аудиозаписей на девяти языках показатель ошибок составил 8,98% против 15,21% у whisper-1.
- Что дает использование контекста в GPT-Transcribe?
В тесте Context Aware ASR семантическая точность GPT-Transcribe выросла с 41,6% до 45,2% при добавлении контекста. OpenAI также заявляет, что модель лучше справляется с акцентами, специализированными терминами, числами и шумным фоном.
Контекст по теме
- Сэм Альтман сообщил о росте использования AI-агентов OpenAI после запуска GPT-5.615 июля 2026 г.
- OpenAI добавила в API модели gpt-realtime-2.1 и gpt-realtime-2.1-mini для голосовых агентов7 июля 2026 г.
- Alibaba Qwen обновила модель распознавания речи Fun-ASR-Realtime с поддержкой 30 языков и 16 диалектов6 июля 2026 г.
- OpenAI представила GPT-Realtime-2, а Anthropic, Natural Language Autoencoders и исследовательский институт9 июня 2026 г.