Alibaba выпустила Qwen-Audio-3.1: пять речевых моделей и скидки до 95% на распознавание и синтез речи
Alibaba выпустила Qwen-Audio-3.1 — пять моделей для распознавания речи, синтеза голоса и разговора в реальном времени — и объявила скидки до 95%. Голосовой ИИ дешевеет быстрее, чем компании успевают его внедрять.

Команда Qwen из Alibaba 23 сентября в 12:11 по Москве представила Qwen-Audio-3.1. Три модели обновили: распознавание речи (ASR), синтез голоса (TTS) и разговорную модель Realtime. Две появились впервые — ASR-Next и TTS-Next. Заодно компания объявила скидки: около 70% на синтез, около 85% на Realtime и до 95% на распознавание. Новые цены в облаке Alibaba Cloud для международных регионов (Сингапур и Пекин) действуют с 21 сентября, 19:00 по Москве (полночь 22 сентября по Пекину).
Что именно выпустила Alibaba
| Модель | Что умеет, по словам компании |
|---|---|
| ASR | Лучше понимает разные языки и диалекты, сама убирает слова-паразиты и повторы из расшифровки |
| ASR-Next | Делит запись по говорящим, ставит метки времени, слышит эмоции и фоновые звуки, отвечает на вопросы по аудио |
| TTS | Синтез на разных языках, перенос голоса с языка на язык, эмоции, темп и манера задаются обычной инструкцией |
| TTS-Next | Голос, звуковые эффекты и фоновая музыка за один проход — для аудиокниг, подкастов, игр и рекламы |
| Realtime | Слушает и говорит одновременно, его можно перебить; услышав грустный голос, говорит медленнее и мягче |
По синтезу компания выложила технический обзор. Там названы 16 языков, из них семь новых, и 86 разметочных меток для смеха, вздоха, кашля и дыхания внутри фразы. Длинный текст модель озвучивает одним куском до 3 минут. Русский есть в демонстрациях многоязычного синтеза. В независимом рейтинге синтеза речи Artificial Analysis модель, как утверждает Alibaba, заняла первое место.
Цифры по скидкам в уведомлении Alibaba Cloud выглядят так (доллары за миллион токенов, регион Сингапур):
| Realtime-flash (поколение 3.0) | Было | Стало | Дешевле |
|---|---|---|---|
| Входящий текст | 0,45 | 0,23 | на 49% |
| Входящий звук | 4,5 | 0,93 | на 79% |
| Исходящий текст | 4,5 | 0,70 | на 84% |
| Исходящий текст и звук | 15 | 1,87 | на 88% |
У синтеза TTS-flash поменялась сама единица счёта. Раньше платили за символы текста: 0,15 доллара за 10 тысяч знаков. Теперь за токены: 0,23 доллара за миллион на входе и 1,87 на выходе. Цифры «около 70%» и «до 95%» взяты из публикации самой команды Qwen. По распознаванию подробной таблицы в уведомлении нет.
Про Россию компания ничего не пишет. Цены опубликованы для международной площадки Alibaba Cloud.
Что это значит для компаний в России
Самая дорогая часть голосового ИИ — звук на входе и выходе. Именно она подешевела сильнее всего: у Realtime-flash исходящий звук с текстом стал дешевле в восемь раз. Живой диалог с перебиванием всё больше похож на рядовую услугу облака. Для бизнеса из этого следуют три вещи.
Каждый звонок можно слушать. Руководитель отдела продаж обычно слушает выборочно, по паре разговоров на менеджера. Остальные уходят в архив, и там же остаются причины, почему клиент «подумает». Когда расшифровка стоит копейки, выборка теряет смысл. Как работает разбор всех звонков по одним критериям, мы писали в статье «Речевая аналитика».
Голосовой ИИ берёт не только входящие. Звонок по свежей заявке, напоминание о встрече, обещанный перезвон через неделю. Раньше такие звонки считали штучно. Теперь их можно делать все.
Цена модели ещё не цена минуты. Вот тут многие ошибаются. Скидка у поставщика модели снижает одну строку сметы. Остаются телефония, сценарий под ваш бизнес, связка с CRM, контроль качества и хранение персональных данных по российским правилам. Бывает так: компания собирает «дешёвого» бота сама, а потом месяц чинит интеграцию и слушает жалобы клиентов.
ИИ-менеджер КАРАДЕСК закрывает эту работу целиком. Он звонит по новой заявке в первую минуту и принимает входящие круглосуточно. Во время разговора отправляет КП, записывает на встречу и передаёт итог в CRM с записью и расшифровкой. Цена — 17,90 ₽ за минуту разговора, интеграции включены, пакет от 1 500 минут в месяц; с ростом объёма минута дешевле. Персональные данные обрабатываются в России по 152-ФЗ. Голосовой проект запускается за 1–5 рабочих дней. Для разбора уже сделанных звонков есть Аналитика: она проходит по каждому звонку и сделке и показывает, где теряются клиенты. Как звучит голосовой менеджер и что проверить до подключения, разобрано в статье «Голосовой ИИ-менеджер».
Коротко
- Alibaba 23 сентября выпустила Qwen-Audio-3.1: обновлённые ASR, TTS и Realtime плюс новые ASR-Next и TTS-Next.
- Команда Qwen объявила скидки: около 70% на синтез, около 85% на Realtime, до 95% на распознавание речи.
- По уведомлению Alibaba Cloud разговорная модель Realtime-flash подешевела на 49–88% в зависимости от типа данных.
- Для бизнеса это значит, что разбор каждого звонка и голосовые разговоры с клиентами стоят всё меньше; цену минуты для компании определяют ещё телефония, интеграции и контроль.
Вопросы и ответы
Что такое Qwen-Audio-3.1?
Линейка из пяти речевых моделей Alibaba: распознавание речи ASR и ASR-Next, синтез голоса TTS и TTS-Next, модель Realtime для разговора в реальном времени с перебиванием.
Насколько подешевели речевые модели Qwen?
По словам команды Qwen: синтез примерно на 70%, Realtime примерно на 85%, распознавание до 95%. В уведомлении Alibaba Cloud для Realtime-flash указано снижение от 49% до 88% в зависимости от того, текст это или звук.
Поддерживает ли Qwen-Audio-3.1 русский язык?
В техническом обзоре синтеза названы 16 языков, русский есть среди демонстраций. О доступности сервиса в России компания не сообщает: цены опубликованы для международной площадки Alibaba Cloud.
Станут ли дешевле голосовые ИИ-сотрудники для бизнеса?
Модели дешевеют, но стоимость минуты для компании складывается ещё из телефонии, сценария, интеграций с CRM и хранения данных. Поэтому смотреть стоит на итоговую цену минуты разговора со всеми подключениями.
Продукт: ИИ-менеджер
Обсудим вашу задачу
Оставьте телефон — перезвоним в рабочее время, покажем демонстрацию на вашем сценарии и честно скажем, где ИИ не подойдёт.








