ElevenLabs выпустила Eleven v4 и v4 Turbo: синтез речи с эмоциями, 90+ языков и первый звук за 150 мс
ElevenLabs выпустила Eleven v4 — новую модель синтеза речи, которая сама считывает из текста интонацию и эмоцию, — и быструю версию Eleven v4 Turbo для голосовых агентов. Turbo начинает говорить примерно через 150 мс, а это уже темп живого телефонного разговора.

ElevenLabs 28 сентября выпустила две модели синтеза речи: Eleven v4 и Eleven v4 Turbo. Первая рассчитана на озвучку, где важнее всего качество. Вторая сделана для разговоров в реальном времени: медианная задержка генерации около 100 мс, первый звук примерно через 150 мс. Анонс вышел в блоге компании около 17:00 по Москве, обе модели доступны сразу.
Что умеют Eleven v4 и v4 Turbo
Компания пишет, что v4 построена на новой архитектуре. Модель читает текст целиком и сама решает, где нужна пауза, где смех, а где тревога в голосе. Тембр говорящего при этом не плывёт даже на длинных фрагментах.
| Что | Eleven v4 | Eleven v4 Turbo |
|---|---|---|
| Для чего | Озвучка, аудиокниги, персонажи | Голосовые агенты, живые звонки |
| Идентификатор в API | `eleven_v4` | `eleven_v4_turbo` |
| Скорость | Приоритет — качество | ~100 мс генерации, ~150 мс до первого звука |
| Языки | Более 90, русский в списке есть | Более 90 |
Что ещё появилось:
- Звуковые теги прямо в тексте. В квадратных скобках можно задать смех, шёпот, акцент или фон: `[laughs]`, `[light rain]`, `[phone buzzing]`. Теги можно ставить друг за другом, а манеру подачи — описывать обычными словами.
- Диалоги нескольких голосов. Модель учитывает, кто кому отвечает, и подстраивает интонацию под собеседника.
- Клонирование голоса. Быструю копию голоса, по словам компании, можно сделать по записи в 10 секунд, профессиональный клон тоже поддерживается. Сходство с оригиналом заметно выросло.
- Произношение по транскрипции. Улучшили поддержку фонетического алфавита IPA: полезно для фамилий, брендов и терминов.
Есть и ограничения. SSML-разметку v4 не понимает, ползунков стиля и скорости нет, остались только настройки стабильности и сходства. Голоса, созданные через генератор по описанию, по признанию самой компании, могут звучать хуже, чем на прошлых моделях.
Модели работают в продуктах ElevenAgents и ElevenCreative и через API. Бесплатный тариф даёт 10 000 кредитов в месяц, этого хватит примерно на 10 минут звука. Платные планы начинаются от 6 долларов в месяц.
По данным ElevenLabs, v4 заняла первое место в рейтинге синтеза речи Artificial Analysis. В слепых сравнениях с другими моделями её выбирали около 75% слушателей.
Что это значит для бизнеса и звонков
Главная новость здесь — Turbo. Компания прямо пишет, что эта версия нужна для поддержки, продаж и записи клиентов. И это понятно: в телефонном разговоре человек ждёт ответа меньше секунды. Если после его вопроса висит тишина, он переспрашивает «алло?» или кладёт трубку.
Второе — эмоции без ручной разметки. Раньше интонацию приходилось прописывать вручную, и голос всё равно звучал ровно, как диктор на вокзале. Теперь модель сама слышит в тексте извинение, шутку или спокойное возражение. Для звонка это разница между «робот зачитал» и «со мной поговорили».
Но быстрый голос — только верхний слой. Клиенту всё равно, как устроен синтез. Ему важно другое:
- Ответили ли быстро. Заявку часто оставляют сразу в трёх местах и выбирают того, кто позвонил первым.
- Поняли ли вопрос. Голос с эмоцией не спасёт, если ответ про цену неверный.
- Что было дальше. Прислали ли КП, записали ли на встречу, перезвонили ли в обещанное время.
Именно эту связку закрывает ИИ-менеджер КАРАДЕСК. Он звонит по новой заявке в первую минуту, принимает входящие круглосуточно, отвечает по базе знаний компании и отрабатывает возражения. КП уходит клиенту прямо во время разговора. Итог попадает в CRM с записью и расшифровкой звонка. Базовая цена — 17,90 ₽ за минуту разговора, интеграции включены, пакет от 1 500 минут в месяц. Запуск занимает от 1 до 5 рабочих дней. Результат продаж не гарантируется: оплачивается работа ИИ-менеджера.
Как звучит голосовой ИИ-сотрудник на звонке и как его проверить до запуска, мы разбирали в статье «Голосовой ИИ-менеджер». А о том, куда движется рынок голосовых агентов и сколько он уже стоит, — в новости об оценке ElevenLabs в 22 млрд долларов.
Для компаний в России есть ещё один вопрос — данные. Записи разговоров с клиентами содержат персональные данные, и по 152-ФЗ их нужно обрабатывать в России. Выбирая голосового агента, стоит спрашивать не только «как звучит», но и «где лежат записи».
Коротко
- ElevenLabs 28 сентября выпустила модели синтеза речи Eleven v4 и Eleven v4 Turbo.
- v4 сама считывает из текста эмоцию и интонацию, понимает звуковые теги и держит тембр на длинных фрагментах.
- Turbo рассчитана на голосовых агентов: ~100 мс генерации и ~150 мс до первого звука.
- Поддерживается более 90 языков, русский в списке есть; SSML и ползунки скорости в v4 убрали.
- Для звонков бизнеса быстрый голос — половина дела, вторая половина — ответ по делу и итог в CRM.
Вопросы и ответы
Что такое Eleven v4?
Новая модель синтеза речи ElevenLabs, вышедшая 28 сентября 2026 года. Она передаёт эмоции и интонацию по смыслу текста и поддерживает звуковые теги. Вместе с ней вышла быстрая версия Eleven v4 Turbo для разговоров в реальном времени.
Чем Eleven v4 Turbo отличается от Eleven v4?
Turbo оптимизирована под скорость: медианная задержка генерации около 100 мс, первый звук примерно через 150 мс. Её делали для голосовых агентов в поддержке, продажах и записи клиентов. Обычная v4 нужна там, где качество озвучки важнее скорости.
Поддерживает ли Eleven v4 русский язык?
Да, русский есть в списке из более чем 90 языков в документации компании.
Сколько стоит Eleven v4?
Модели доступны и на бесплатном тарифе: 10 000 кредитов в месяц, примерно 10 минут звука. Платные планы начинаются от 6 долларов в месяц, для крупных компаний цена договорная.
Продукт: ИИ-менеджер
Обсудим вашу задачу
Оставьте телефон — перезвоним в рабочее время, покажем демонстрацию на вашем сценарии и честно скажем, где ИИ не подойдёт.








