ElevenLabs выпустила модели синтеза речи v4 и v4 Turbo. Для клонирования голоса теперь достаточно 10 секунд аудио, а число поддерживаемых языков выросло с 70 до более чем 90, пишет TechCrunch.
В основе v4 новая архитектура, которая быстрее копирует голос и лучше сохраняет его особенности при озвучивании длинных текстов. Модель учитывает контекст фразы и меняет подачу, а текстовые метки эмоций теперь можно сочетать и выстраивать в последовательность. Например, автор может задать смену нескольких интонаций внутри одной реплики.
Справка. ElevenLabs. Компания разрабатывает модели генерации речи и голосовых агентов. Более 55% ее бизнеса приходится на крупных корпоративных клиентов, штат превышает 800 человек. Выручка в годовом выражении выросла примерно с $330 млн в начале года до более чем $600 млн, а последняя инвестиционная оценка составила $11 млрд.
Обе новые модели работают с меньшей задержкой, что важно для голосовых агентов, отвечающих клиентам по телефону. Генерация звука может начинаться сразу, как только языковая модель формирует ответ. ElevenLabs также заявляет, что система по-разному обрабатывает конфликтные разговоры, обострение ситуации и удержание на линии. Самый заметный рост качества компания увидела в японском, бразильском варианте португальского, путунхуа и кантонском китайском.
Предыдущую модель v3 ElevenLabs выпустила год назад, а v4 показывала ранее на мероприятии в Варшаве. Теперь это коммерческий запуск на фоне конкуренции с Cartesia, Deepgram, Fish Audio, Boson, WellSaid Labs, Google и OpenAI, которые также развивают выразительный синтез речи.
Что это значит
- Для вас. Озвучивать ролики, подкасты и длинные тексты можно голосом, собранным из короткого образца, с более точным управлением интонацией. Однако качество русского языка нужно проверять отдельно: TechCrunch не приводит его оценку.
- В России. Доступность ElevenLabs из РФ, цены в рублях и возможность оплаты российскими картами в источнике не указаны.
- Что сделать. Перед внедрением протестируйте русский язык на длинном тексте и живом диалоге, где особенно заметны сбои интонации и смена голоса. Чужую запись для клонирования стоит использовать только с согласия владельца: десятисекундный порог заметно упрощает создание голосовых подделок.
- За чем следить. Главный маркер для голосовых агентов: сохранится ли низкая задержка в реальных звонках, когда разговор прерывается, обостряется или ставится на удержание.
