Gemini 3.8 Flash TTS: Google выпустила синтез речи с голосом по описанию и копией голоса по записи
Google выпустила Gemini 3.8 Flash TTS и облегчённую Flash-Lite TTS. Голос теперь описывают словами, а копию голоса человека делают по записи до 30 секунд — только с его согласием. Минута синтеза стоит около цента.

Google выпустила две модели синтеза речи: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Компания рассказала о них в своём блоге 23 сентября. Главное новшество в том, что голос больше не выбирают из списка. Его описывают обычным текстом — возраст, манера, акцент, настроение, — и модель собирает новый. Второе новшество — копия голоса конкретного человека по короткой записи. Но только если владелец голоса сам записал согласие.
Что именно выпустила Google
| Что | Flash TTS | Flash-Lite TTS |
|---|---|---|
| Для чего, по анонсу | тонкая режиссура и создание персонажей | большие объёмы по низкой цене: дубляж, аудиоконтент, голосовые агенты |
| Языков по документации | 130, русский есть | 101, русский есть |
| Звук на выходе, до 31.12.2026 | $9 за 1 млн аудиотокенов | $6 за 1 млн аудиотокенов |
| Звук на выходе, с 01.01.2027 | $18 | $12 |
| Текст на входе | $0,50 за 1 млн токенов, с 2027 года — $1 | так же |
| Пакетный режим | вдвое дешевле обычного | вдвое дешевле обычного |
| Бесплатный уровень | есть | есть |
| Где доступна | Gemini API и Google AI Studio; в Gemini Notebook; Gemini Enterprise — скоро | Gemini API и Google AI Studio; в Google Vids; Gemini Enterprise — скоро |
Сколько это в минутах? В прайсе сказано: секунда звука — 25 аудиотокенов. Значит, минута речи — 1 500 токенов. До конца года это примерно 1,35 цента за минуту на Flash и 0,9 цента на Flash-Lite, без учёта входного текста. С января — вдвое дороже. Это наш расчёт по прайсу, в анонсе такой цифры нет.
Что умеют модели, по блогу и документации:
- Голос по описанию. Персонажа задают словами, без записи диктора. Кроме того, есть 30 готовых голосов и расширенная библиотека; в анонсе компания говорит о более чем 2 000 голосов.
- Режиссура по строчкам. К каждой реплике можно дописать ремарку: темп, интонация, смена диалекта. Смех, вздох и поддакивание вроде «угу» или «ага» вставляются прямо в текст.
- Диалог в одном запросе. Два говорящих в одной сцене.
- Длинные записи. По словам компании, тембр и темп держатся на часах непрерывного звука.
- Потоковая выдача. Звук приходит по мере синтеза, не надо ждать всю фразу целиком.
- Копия голоса. По документации нужен чистый фрагмент речи на 10–30 секунд и отдельная запись, где владелец голоса произносит фразу согласия. Система сверяет, что согласие дал тот же человек. Русский текст согласия в документации уже есть. В проекте хранится до 200 голосов, срок хранения — год.
- Метки. В каждый сгенерированный звук вшит водяной знак SynthID, на слух его не слышно. К копиям голоса добавляются сведения о происхождении по стандарту C2PA.
- Оценки. По данным компании, Flash заняла первое место в рейтинге создания голосов Hume AI с результатом 71,4. В общем индексе качества того же рейтинга модели на первом и втором местах.
Ограничения тоже есть. Копирование голоса через AI Studio недоступно в штатах Иллинойс и Техас, в Европейской экономической зоне, Великобритании, Швейцарии и Индии. России нет в списке стран, где работает Gemini API, так что официально из России модели недоступны.
Что это значит для бизнеса
Синтез речи дешевеет и звучит всё живее. Минута голоса стоит центы. Паузу, вздох, короткое «угу» в ответ на реплику собеседника можно прописать прямо в тексте. Робот, который читает по слогам и перебивает на полуслове, уходит в прошлое. Для телефонных продаж это хорошая новость: клиент реже кладёт трубку на первой фразе только потому, что услышал машину.
Но голос — это обёртка. Сделку решает то, что происходит внутри разговора. Позвонили ли через минуту после заявки или на следующее утро. Ответили ли на вопрос о цене без «уточню и перезвоню». Записали ли на замер. Попал ли итог в CRM, или менеджер «потом внесёт». Красивый тембр не спасёт разговор, если клиент уже внёс предоплату тем, кто ответил первым. Мы разбирали эту разницу в статье голосовой робот или ИИ-менеджер.
Где дешёвый живой голос окупается первым:
- входящая линия вечером и в выходные, когда офис закрыт;
- перезвон по свежей заявке с сайта или из рекламы;
- напоминания о встрече и подтверждение записи;
- озвучка обучающих роликов для сотрудников.
Обратная сторона: чужой голос за полминуты
Копии голоса хватает полминуты записи. Это и есть главный риск. Схема знакомая: бухгалтеру звонит «директор» и срочно просит оплатить счёт. Голос похож, номер незнакомый, «я с другого телефона». У Google стоят заслоны — запись согласия и водяной знак. Но мошенникам не обязательно пользоваться сервисом, который спрашивает согласие.
Что стоит ввести в компании уже сейчас:
- платежи по голосовому указанию не проводить, только по письменной заявке в привычном канале;
- при странной просьбе перезванивать на номер из справочника компании, а не на тот, с которого звонили;
- для срочных распоряжений договориться о кодовом слове;
- если хотите фирменный голос на основе голоса сотрудника — брать письменное согласие. Запись голоса относится к персональным данным, и порядок её хранения описан в нашей статье о записи разговоров и 152-ФЗ.
И про честность. Чем естественнее звучит синтез, тем важнее, чтобы на прямой вопрос «я с роботом говорю?» ответ был правдивым. Иначе доверие рушится на первом же звонке.
Что закрывает ИИ-менеджер
ИИ-менеджер КАРАДЕСК берёт на себя тот самый первый разговор. Он звонит по новой заявке в первую минуту, в том числе ночью и в выходные, и круглосуточно принимает входящие без очереди на линии. Его можно перебить, задать вопрос или возразить — это живой разговор, а не меню с кнопками. Пока клиент на линии, он отправляет КП по шаблону компании, записывает на встречу в свободный слот и передаёт итог в CRM с записью разговора. Представляется по согласованному сценарию и требованиям закона, на прямой вопрос отвечает честно. Цена — 17,90 ₽ за минуту разговора, интеграции включены, пакет от 1 500 минут в месяц. Продажи он не обещает: оплачивается работа, а не итог.
Коротко
- Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS: голос можно описать словами, а не выбирать из списка.
- Копия голоса делается по записи 10–30 секунд и только с записанным согласием владельца.
- До конца 2026 года выход звука стоит $9 и $6 за 1 млн аудиотокенов — около цента за минуту; с 2027 года вдвое дороже.
- Официально из России модели недоступны, хотя русский язык поддерживают.
- Для бизнеса синтез голоса дешевеет, но выручку решает скорость и содержание разговора. А правила против голосовых мошенников пора вводить уже сейчас.
Вопросы и ответы
Можно ли пользоваться Gemini 3.8 Flash TTS из России?
Официально нет: России нет в списке стран, где доступен Gemini API. Русский язык при этом в обеих моделях поддерживается.
Сколько стоит Gemini 3.8 Flash TTS?
До 31 декабря 2026 года — $9 за 1 млн аудиотокенов на выходе и $0,50 за 1 млн токенов текста на входе. Flash-Lite TTS — $6 за звук. С 1 января 2027 года цены удваиваются. Есть бесплатный уровень и пакетный режим за полцены.
Можно ли скопировать чужой голос в Gemini 3.8 Flash TTS?
По правилам Google — нет. Нужна запись, где владелец голоса произносит фразу согласия, и система сверяет её с образцом. Каждый звук помечается водяным знаком SynthID.
Чем Flash TTS отличается от Flash-Lite TTS?
Flash сделана для тонкой режиссуры и персонажей и знает 130 языков. Flash-Lite дешевле, рассчитана на большие объёмы — дубляж, аудиоконтент, голосовые агенты — и знает 101 язык.
Продукт: ИИ-менеджер
Обсудим вашу задачу
Оставьте телефон — перезвоним в рабочее время, покажем демонстрацию на вашем сценарии и честно скажем, где ИИ не подойдёт.





