Gemini 3.8 Flash TTS: Google выпустила синтез речи с голосом по описанию и копией голоса по записи

Новости ИИ · · Источник: блог компании Google и документация Gemini API · Редакция КАРАДЕСК

Google выпустила Gemini 3.8 Flash TTS и облегчённую Flash-Lite TTS. Голос теперь описывают словами, а копию голоса человека делают по записи до 30 секунд — только с его согласием. Минута синтеза стоит около цента.

Обложка новости — Google: Gemini 3.8 Flash TTS. Голос по описанию и копия голоса по 30 секундам записи. Объёмный знак КАРАДЕСК и значок темы «звук»

Google выпустила две модели синтеза речи: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. Компания рассказала о них в своём блоге 23 сентября. Главное новшество в том, что голос больше не выбирают из списка. Его описывают обычным текстом — возраст, манера, акцент, настроение, — и модель собирает новый. Второе новшество — копия голоса конкретного человека по короткой записи. Но только если владелец голоса сам записал согласие.

Что именно выпустила Google

ЧтоFlash TTSFlash-Lite TTS
Для чего, по анонсутонкая режиссура и создание персонажейбольшие объёмы по низкой цене: дубляж, аудиоконтент, голосовые агенты
Языков по документации130, русский есть101, русский есть
Звук на выходе, до 31.12.2026$9 за 1 млн аудиотокенов$6 за 1 млн аудиотокенов
Звук на выходе, с 01.01.2027$18$12
Текст на входе$0,50 за 1 млн токенов, с 2027 года — $1так же
Пакетный режимвдвое дешевле обычноговдвое дешевле обычного
Бесплатный уровеньестьесть
Где доступнаGemini API и Google AI Studio; в Gemini Notebook; Gemini Enterprise — скороGemini API и Google AI Studio; в Google Vids; Gemini Enterprise — скоро

Сколько это в минутах? В прайсе сказано: секунда звука — 25 аудиотокенов. Значит, минута речи — 1 500 токенов. До конца года это примерно 1,35 цента за минуту на Flash и 0,9 цента на Flash-Lite, без учёта входного текста. С января — вдвое дороже. Это наш расчёт по прайсу, в анонсе такой цифры нет.

Что умеют модели, по блогу и документации:

  • Голос по описанию. Персонажа задают словами, без записи диктора. Кроме того, есть 30 готовых голосов и расширенная библиотека; в анонсе компания говорит о более чем 2 000 голосов.
  • Режиссура по строчкам. К каждой реплике можно дописать ремарку: темп, интонация, смена диалекта. Смех, вздох и поддакивание вроде «угу» или «ага» вставляются прямо в текст.
  • Диалог в одном запросе. Два говорящих в одной сцене.
  • Длинные записи. По словам компании, тембр и темп держатся на часах непрерывного звука.
  • Потоковая выдача. Звук приходит по мере синтеза, не надо ждать всю фразу целиком.
  • Копия голоса. По документации нужен чистый фрагмент речи на 10–30 секунд и отдельная запись, где владелец голоса произносит фразу согласия. Система сверяет, что согласие дал тот же человек. Русский текст согласия в документации уже есть. В проекте хранится до 200 голосов, срок хранения — год.
  • Метки. В каждый сгенерированный звук вшит водяной знак SynthID, на слух его не слышно. К копиям голоса добавляются сведения о происхождении по стандарту C2PA.
  • Оценки. По данным компании, Flash заняла первое место в рейтинге создания голосов Hume AI с результатом 71,4. В общем индексе качества того же рейтинга модели на первом и втором местах.

Ограничения тоже есть. Копирование голоса через AI Studio недоступно в штатах Иллинойс и Техас, в Европейской экономической зоне, Великобритании, Швейцарии и Индии. России нет в списке стран, где работает Gemini API, так что официально из России модели недоступны.

Что это значит для бизнеса

Синтез речи дешевеет и звучит всё живее. Минута голоса стоит центы. Паузу, вздох, короткое «угу» в ответ на реплику собеседника можно прописать прямо в тексте. Робот, который читает по слогам и перебивает на полуслове, уходит в прошлое. Для телефонных продаж это хорошая новость: клиент реже кладёт трубку на первой фразе только потому, что услышал машину.

Но голос — это обёртка. Сделку решает то, что происходит внутри разговора. Позвонили ли через минуту после заявки или на следующее утро. Ответили ли на вопрос о цене без «уточню и перезвоню». Записали ли на замер. Попал ли итог в CRM, или менеджер «потом внесёт». Красивый тембр не спасёт разговор, если клиент уже внёс предоплату тем, кто ответил первым. Мы разбирали эту разницу в статье голосовой робот или ИИ-менеджер.

Где дешёвый живой голос окупается первым:

  • входящая линия вечером и в выходные, когда офис закрыт;
  • перезвон по свежей заявке с сайта или из рекламы;
  • напоминания о встрече и подтверждение записи;
  • озвучка обучающих роликов для сотрудников.

Обратная сторона: чужой голос за полминуты

Копии голоса хватает полминуты записи. Это и есть главный риск. Схема знакомая: бухгалтеру звонит «директор» и срочно просит оплатить счёт. Голос похож, номер незнакомый, «я с другого телефона». У Google стоят заслоны — запись согласия и водяной знак. Но мошенникам не обязательно пользоваться сервисом, который спрашивает согласие.

Что стоит ввести в компании уже сейчас:

  • платежи по голосовому указанию не проводить, только по письменной заявке в привычном канале;
  • при странной просьбе перезванивать на номер из справочника компании, а не на тот, с которого звонили;
  • для срочных распоряжений договориться о кодовом слове;
  • если хотите фирменный голос на основе голоса сотрудника — брать письменное согласие. Запись голоса относится к персональным данным, и порядок её хранения описан в нашей статье о записи разговоров и 152-ФЗ.

И про честность. Чем естественнее звучит синтез, тем важнее, чтобы на прямой вопрос «я с роботом говорю?» ответ был правдивым. Иначе доверие рушится на первом же звонке.

Что закрывает ИИ-менеджер

ИИ-менеджер КАРАДЕСК берёт на себя тот самый первый разговор. Он звонит по новой заявке в первую минуту, в том числе ночью и в выходные, и круглосуточно принимает входящие без очереди на линии. Его можно перебить, задать вопрос или возразить — это живой разговор, а не меню с кнопками. Пока клиент на линии, он отправляет КП по шаблону компании, записывает на встречу в свободный слот и передаёт итог в CRM с записью разговора. Представляется по согласованному сценарию и требованиям закона, на прямой вопрос отвечает честно. Цена — 17,90 ₽ за минуту разговора, интеграции включены, пакет от 1 500 минут в месяц. Продажи он не обещает: оплачивается работа, а не итог.

Коротко

  • Google выпустила Gemini 3.8 Flash TTS и Flash-Lite TTS: голос можно описать словами, а не выбирать из списка.
  • Копия голоса делается по записи 10–30 секунд и только с записанным согласием владельца.
  • До конца 2026 года выход звука стоит $9 и $6 за 1 млн аудиотокенов — около цента за минуту; с 2027 года вдвое дороже.
  • Официально из России модели недоступны, хотя русский язык поддерживают.
  • Для бизнеса синтез голоса дешевеет, но выручку решает скорость и содержание разговора. А правила против голосовых мошенников пора вводить уже сейчас.

Вопросы и ответы

Можно ли пользоваться Gemini 3.8 Flash TTS из России?

Официально нет: России нет в списке стран, где доступен Gemini API. Русский язык при этом в обеих моделях поддерживается.

Сколько стоит Gemini 3.8 Flash TTS?

До 31 декабря 2026 года — $9 за 1 млн аудиотокенов на выходе и $0,50 за 1 млн токенов текста на входе. Flash-Lite TTS — $6 за звук. С 1 января 2027 года цены удваиваются. Есть бесплатный уровень и пакетный режим за полцены.

Можно ли скопировать чужой голос в Gemini 3.8 Flash TTS?

По правилам Google — нет. Нужна запись, где владелец голоса произносит фразу согласия, и система сверяет её с образцом. Каждый звук помечается водяным знаком SynthID.

Чем Flash TTS отличается от Flash-Lite TTS?

Flash сделана для тонкой режиссуры и персонажей и знает 130 языков. Flash-Lite дешевле, рассчитана на большие объёмы — дубляж, аудиоконтент, голосовые агенты — и знает 101 язык.

Продукт: ИИ-менеджер

Обсудим вашу задачу

Оставьте телефон — перезвоним в рабочее время, покажем демонстрацию на вашем сценарии и честно скажем, где ИИ не подойдёт.

Подробнее о продукте «ИИ-менеджер»

Заявка принята

Перезвоним в рабочее время. Спасибо, что дочитали!

Свежие новости ИИ

Обложка новости — 2ГИС: MCP-сервер 2ГИС для бизнеса. ИИ-ассистенты компаний ищут адреса и строят маршруты. Объёмный знак КАРАДЕСК и значок темы «карта»24 сентября 2026, 09:50 МСК2ГИС выпустил MCP-сервер для бизнеса: ИИ-ассистенты компаний научатся искать адреса и строить маршрутыMCP-сервер 2ГИС подключает корпоративных ИИ-ассистентов к картам, справочнику организаций и маршрутам без отдельной интеграции под каждую задачу. Для логистики, доставки и выездных служб это ассистент, который сам знает, куда и сколько ехать.Обложка новости — NVIDIA: NV-Reason-CT. Открытая модель читает 3D-снимки КТ и объясняет ход мысли. Объёмный знак КАРАДЕСК и значок темы «медицина»24 сентября 2026, 09:50 МСКNV-Reason-CT: NVIDIA открыла модель, которая читает 3D-снимки КТ и объясняет ход мыслиNV-Reason-CT — открытая модель NVIDIA, которая разбирает объёмный снимок КТ и пишет отчёт с пошаговыми рассуждениями, как рентгенолог. Это инструмент для исследователей и разработчиков, а не готовый диагноз для пациента.Обложка новости — Google: Бесплатные HD-видео в Google Vids. Gemini Omni 1.1 Flash открыта всем аккаунтам Google. Объёмный знак КАРАДЕСК и значок темы «видео»24 сентября 2026, 07:57 МСКGemini Omni в Google Vids: Google открыла бесплатное создание HD-видео по тексту для всех аккаунтовGemini Omni в Google Vids теперь доступна любому владельцу аккаунта Google: ролик в 1080p можно собрать по текстовому описанию бесплатно. Для малого бизнеса это рекламное видео без студии и монтажёра.

Читайте в статьях

Обложка статьи — Голосовой робот для звонков или ИИ-менеджер. Плашка «ИИ-менеджер», объёмный знак КАРАДЕСК и значок темы «звук»Голосовые технологии · 7 минГолосовой робот для звонков или ИИ-менеджер: в чём разница и что выбратьГолосовой робот для звонков проигрывает заготовленные фразы и ждёт «да» или «нет». ИИ-менеджер ведёт разговор: отвечает на вопросы, спорит по делу, отправляет КП и записывает итог в CRM. Разница слышна на первом же вопросе, которого нет в сценарии.Обложка статьи — ИИ-менеджер по продажам. звонок, сделка и CRM. Плашка «ИИ-менеджер», объёмный знак КАРАДЕСК и значок темы «телефон»ИИ в продажах · 8 минИИ-менеджер по продажам: как он звонит, продаёт и заносит сделки в CRMИИ-менеджер по продажам — голосовой сотрудник, который перезванивает по заявке в первую минуту, ведёт живой разговор, отправляет КП, записывает на встречу и сам заполняет сделку в CRM. Живой менеджер получает клиента с понятной потребностью и полной историей. Ниже — путь одной заявки по минутам и честная граница, за которой нужен человек.Обложка статьи — Коммерческое предложение во время звонка клиенту. Плашка «ИИ-менеджер», объёмный знак КАРАДЕСК и значок темы «телефон»ИИ в продажах · 7 минКоммерческое предложение во время звонка: как ИИ-менеджер собирает КП, пока клиент на линииКоммерческое предложение во время звонка уходит клиенту на почту, пока он ещё на линии: по шаблону компании, с ценами из прайса. Там, где прораб обзванивает поставщиков за двадцать минут, это часто решает, чьё КП откроют первым. Ниже — как это устроено, что подготовить и где без человека нельзя.