К содержанию

Продукт

ElevenLabs выпустила v4: голос копируется по 10 секундам аудио

Новая модель точнее управляет эмоциями, сохраняет голос на длинных текстах и поддерживает более 90 языков.

В Telegram

ElevenLabs выпустила модели синтеза речи v4 и v4 Turbo. Для клонирования голоса теперь достаточно 10 секунд аудио, а число поддерживаемых языков выросло с 70 до более чем 90, пишет TechCrunch.

В основе v4 новая архитектура, которая быстрее копирует голос и лучше сохраняет его особенности при озвучивании длинных текстов. Модель учитывает контекст фразы и меняет подачу, а текстовые метки эмоций теперь можно сочетать и выстраивать в последовательность. Например, автор может задать смену нескольких интонаций внутри одной реплики.

Справка. ElevenLabs. Компания разрабатывает модели генерации речи и голосовых агентов. Более 55% ее бизнеса приходится на крупных корпоративных клиентов, штат превышает 800 человек. Выручка в годовом выражении выросла примерно с $330 млн в начале года до более чем $600 млн, а последняя инвестиционная оценка составила $11 млрд.

Обе новые модели работают с меньшей задержкой, что важно для голосовых агентов, отвечающих клиентам по телефону. Генерация звука может начинаться сразу, как только языковая модель формирует ответ. ElevenLabs также заявляет, что система по-разному обрабатывает конфликтные разговоры, обострение ситуации и удержание на линии. Самый заметный рост качества компания увидела в японском, бразильском варианте португальского, путунхуа и кантонском китайском.

Предыдущую модель v3 ElevenLabs выпустила год назад, а v4 показывала ранее на мероприятии в Варшаве. Теперь это коммерческий запуск на фоне конкуренции с Cartesia, Deepgram, Fish Audio, Boson, WellSaid Labs, Google и OpenAI, которые также развивают выразительный синтез речи.

Что это значит

  • Для вас. Озвучивать ролики, подкасты и длинные тексты можно голосом, собранным из короткого образца, с более точным управлением интонацией. Однако качество русского языка нужно проверять отдельно: TechCrunch не приводит его оценку.
  • В России. Доступность ElevenLabs из РФ, цены в рублях и возможность оплаты российскими картами в источнике не указаны.
  • Что сделать. Перед внедрением протестируйте русский язык на длинном тексте и живом диалоге, где особенно заметны сбои интонации и смена голоса. Чужую запись для клонирования стоит использовать только с согласия владельца: десятисекундный порог заметно упрощает создание голосовых подделок.
  • За чем следить. Главный маркер для голосовых агентов: сохранится ли низкая задержка в реальных звонках, когда разговор прерывается, обостряется или ставится на удержание.
Как процитировать этот материал

«ElevenLabs выпустила v4: голос копируется по 10 секундам аудио». hegai.media, 28 сентября 2026 г.. https://hegai.media/novosti/elevenlabs-vypustila-v4-golos-kopiruetsya-po-10-sekundam-audio--8bb22119-7f7f-4bac-a631-471495d3c05d