Qwen Audio 3.0 TTS Plus от Alibaba возглавил мировой рейтинг голосовых ИИ

Когда Alibaba тихо выкатывает новую TTS-модель, это редко остаётся незамеченным. Qwen-Audio-3.0-TTS-Plus не просто вышел — он сразу занял первое место в независимом рейтинге Artificial Analysis Speech Arena, обогнав всех ключевых игроков рынка синтеза речи. Это не маркетинговое заявление самой компании, а результат независимого бенчмарка, что делает победу куда весомее.
Кто и на сколько проиграл
Цифры говорят сами за себя. Qwen-Audio-3.0-TTS-Plus набрал 1236 Elo-очков, оставив позади SpeechifyAI Simba 3.2 с результатом 1234 — разрыв минимальный, буквально два балла. Дальше идут Gemini 3.1 Flash TTS (1214) и Sonic 3.5 (1207). Разрыв между лидером и четвёртым местом — почти 30 очков, что в Elo-системе уже ощутимо.
По критерию разборчивости речи модель также показывает сильные результаты: средний показатель WER/CER у Flash-версии составляет 3.87, у Plus — 3.96 (чем ниже, тем лучше). Это лучшие значения среди конкурентов в 10 из 16 поддерживаемых языков. По сходству с голосом-образцом Plus занимает первое место с показателем 82.75 из 100 по всем 16 языкам.
Два варианта — две задачи
Алибаба выпустила модель в двух конфигурациях с чёткой специализацией. Flash заточен под реалтайм-взаимодействие: задержка первого пакета — около 300 миллисекунд, что вполне приемлемо для голосовых ассистентов и диалоговых систем. Plus ориентирован на максимальное качество — там важна естественность интонации и точная передача тембра голоса.
Оба варианта доступны исключительно как облачный сервис через Alibaba Cloud Model Studio — никаких скачиваемых весов нет. API работает по двустороннему WebSocket-протоколу, поддерживает форматы PCM, WAV, MP3 и Opus, а максимальная частота дискретизации — 48 кГц. SDK предоставляется для Python, Java, Go, C#, PHP и Node.js, с поддержкой Singapore и Beijing регионов.
16 языков и 86 тегов эмоций
Языковое покрытие — одна из сильных сторон модели. Поддерживаются 16 языков: арабский, китайский, английский, французский, немецкий, индонезийский, итальянский, японский, корейский, малайский, португальский, русский, испанский, тагальский, тайский и вьетнамский. Семь из них добавлены впервые по сравнению с предыдущим поколением. Отдельно охвачены 20 диалектных регионов китайского языка — что для глобального рынка может быть неочевидной, но критически важной деталью.
Для разработчиков, которым нужен тонкий контроль над интонацией, предусмотрены 86 инлайн-тегов. Они делятся на два типа. Управляющие теги — `[excited]`, `[sad]`, `[whispers]`, `[asmr]` — задают эмоциональный тон на весь последующий текст до следующего тега. Теги событий — `[laughing]`, `[gasp]`, `[clears throat]` — вставляют одиночный невербальный звук, не меняя общей интонации. Выглядит это примерно так: `[excited]Какой прекрасный день![laughing]Давайте выйдем погулять!` Для подкастов, аудиокниг и интерактивных NPC в играх — это серьёзный инструмент.
Клонирование голоса тоже прокачали: модель лучше справляется с зашумлёнными или эхо-содержащими записями-образцами, что снимает одно из главных ограничений предыдущих версий.
Ахиллесова пята: скорость
Вот здесь всё не так радужно. Qwen-Audio-3.0-TTS-Plus генерирует всего 16 символов в секунду — и это катастрофически мало на фоне конкурентов. Sonic 3.5 выдаёт 120 символов в секунду, Simba 3.2 — 30.2 символа в секунду. То есть по скорости Alibaba отстаёт от лидера в 7,5 раз.
Для приложений с реалтайм-требованиями это серьёзный барьер. Можно занять первое место в рейтинге качества, но если синтез длинного текста занимает минуты, а не секунды — многие сценарии просто отпадают. Показательно, что сам Alibaba разделил продукт на Flash и Plus именно потому, что Plus в реалтайм не годится.
Цена и доступность
Ценообразование: $27.60 за миллион символов через Alibaba Cloud Model Studio. Для сравнения — это средний ценовой диапазон для топовых TTS-сервисов. ElevenLabs на своих корпоративных планах берёт сопоставимо, Google Cloud TTS в зависимости от голоса обходится дешевле на стандартных, но дороже на премиальных.
Для российской аудитории ситуация привычная: сервис работает через Alibaba Cloud, российские карты туда не принимаются, потребуется зарубежная карта или виртуальный счёт. Технически доступ возможен, но с рядом ограничений — как у большинства западных и азиатских облачных платформ.
Что это значит для рынка
Победа в рейтинге Artificial Analysis — это не просто строчка в пресс-релизе. Speech Arena использует Elo-систему, аналогичную той, что применяется для оценки языковых моделей в Chatbot Arena, то есть оценки дают реальные пользователи в слепых тестах. Когда модель Alibaba обходит и Google, и ElevenLabs, и Speechify — это сигнал для всей индустрии.
Технически интересно архитектурное решение: 12.5 Hz речевой токенизатор с низкой частотой кадров снижает стоимость авторегрессивного декодирования, сохраняя при этом информацию о содержании и голосе. Пятиэтапная схема обучения — от предобучения LM и FM-компонентов до отдельного RL для каждого из них — явно даёт результат в качестве, хотя и не решает проблему скорости.
Если Alibaba в следующей версии подтянет throughput хотя бы до уровня Simba 3.2, у конкурентов начнутся серьёзные проблемы. Пока же это история о том, как можно быть лучшим по качеству и при этом оставаться в хвосте по производительности — классический компромисс, с которым рынок TTS разбирается уже не первый год.
Информация о выходе модели и её позиции в рейтингах подтверждена несколькими независимыми публикациями.
Источники
Похожие новости
Google Assistant умрёт 4 сентября: Gemini или ничего
Google официально объявила дату смерти Assistant на Android — 4 сентября 2026 года. Миллионы пользователей переведут на Gemini принудительно, без права вернуться назад.
Голос Claude стал умнее: Opus и Sonnet теперь говорят вместо Haiku
Anthropic переводит голосовой режим Claude на топовые модели и добавляет интеграцию с Gmail, Slack и Calendar — первый голосовой ИИ, реально отправляющий письма.
Голосовой режим Claude теперь работает с Opus и Sonnet
Anthropic открыла голосовой режим для своих мощных моделей Opus и Sonnet — теперь голосом можно решать реальные бизнес-задачи, а не только спрашивать погоду.