Qwen Audio 3.0 TTS Plus от Alibaba возглавил мировой рейтинг голосовых ИИ

Когда Alibaba тихо выкатывает новую TTS-модель, это редко остается незамеченным. Qwen-Audio-3.0-TTS-Plus не просто вышел - он сразу занял первое место в независимом рейтинге Artificial Analysis Speech Arena, обогнав всех ключевых игроков рынка синтеза речи. Это не маркетинговое заявление самой компании, а результат независимого бенчмарка, что делает победу куда весомее.
Кто и на сколько проиграл
Цифры говорят сами за себя. Qwen-Audio-3.0-TTS-Plus набрал 1236 Elo-очков, оставив позади SpeechifyAI Simba 3.2 с результатом 1234 - разрыв минимальный, буквально два балла. Дальше идут Gemini 3.1 Flash TTS (1214) и Sonic 3.5 (1207). Разрыв между лидером и четвертым местом - почти 30 очков, что в Elo-системе уже ощутимо.
По критерию разборчивости речи модель также показывает сильные результаты: средний показатель WER/CER у Flash-версии составляет 3.87, у Plus - 3.96 (чем ниже, тем лучше). Это лучшие значения среди конкурентов в 10 из 16 поддерживаемых языков. По сходству с голосом-образцом Plus занимает первое место с показателем 82.75 из 100 по всем 16 языкам.
Два варианта - две задачи
Алибаба выпустила модель в двух конфигурациях с четкой специализацией. Flash заточен под реалтайм-взаимодействие: задержка первого пакета - около 300 миллисекунд, что вполне приемлемо для голосовых ассистентов и диалоговых систем. Plus ориентирован на максимальное качество - там важна естественность интонации и точная передача тембра голоса.
Оба варианта доступны исключительно как облачный сервис через Alibaba Cloud Model Studio - никаких скачиваемых весов нет. API работает по двустороннему WebSocket-протоколу, поддерживает форматы PCM, WAV, MP3 и Opus, а максимальная частота дискретизации - 48 кГц. SDK предоставляется для Python, Java, Go, C#, PHP и Node.js, с поддержкой Singapore и Beijing регионов.
16 языков и 86 тегов эмоций
Языковое покрытие - одна из сильных сторон модели. Поддерживаются 16 языков: арабский, китайский, английский, французский, немецкий, индонезийский, итальянский, японский, корейский, малайский, португальский, русский, испанский, тагальский, тайский и вьетнамский. Семь из них добавлены впервые по сравнению с предыдущим поколением. Отдельно охвачены 20 диалектных регионов китайского языка - что для глобального рынка может быть неочевидной, но критически важной деталью.
Для разработчиков, которым нужен тонкий контроль над интонацией, предусмотрены 86 инлайн-тегов. Они делятся на два типа. Управляющие теги - `[excited]`, `[sad]`, `[whispers]`, `[asmr]` - задают эмоциональный тон на весь последующий текст до следующего тега. Теги событий - `[laughing]`, `[gasp]`, `[clears throat]` - вставляют одиночный невербальный звук, не меняя общей интонации. Выглядит это примерно так: `[excited]Какой прекрасный день![laughing]Давайте выйдем погулять!` Для подкастов, аудиокниг и интерактивных NPC в играх - это серьезный инструмент.
Клонирование голоса тоже прокачали: модель лучше справляется с зашумленными или эхо-содержащими записями-образцами, что снимает одно из главных ограничений предыдущих версий.
Ахиллесова пята: скорость
Вот здесь все не так радужно. Qwen-Audio-3.0-TTS-Plus генерирует всего 16 символов в секунду - и это катастрофически мало на фоне конкурентов. Sonic 3.5 выдает 120 символов в секунду, Simba 3.2 - 30.2 символа в секунду. То есть по скорости Alibaba отстает от лидера в 7,5 раз.
Для приложений с реалтайм-требованиями это серьезный барьер. Можно занять первое место в рейтинге качества, но если синтез длинного текста занимает минуты, а не секунды - многие сценарии просто отпадают. Показательно, что сам Alibaba разделил продукт на Flash и Plus именно потому, что Plus в реалтайм не годится.
Цена и доступность
Ценообразование: $27.60 за миллион символов через Alibaba Cloud Model Studio. Для сравнения - это средний ценовой диапазон для топовых TTS-сервисов. ElevenLabs на своих корпоративных планах берет сопоставимо, Google Cloud TTS в зависимости от голоса обходится дешевле на стандартных, но дороже на премиальных.
Для российской аудитории ситуация привычная: сервис работает через Alibaba Cloud, российские карты туда не принимаются, потребуется зарубежная карта или виртуальный счет. Технически доступ возможен, но с рядом ограничений - как у большинства западных и азиатских облачных платформ.
Что это значит для рынка
Победа в рейтинге Artificial Analysis - это не просто строчка в пресс-релизе. Speech Arena использует Elo-систему, аналогичную той, что применяется для оценки языковых моделей в Chatbot Arena, то есть оценки дают реальные пользователи в слепых тестах. Когда модель Alibaba обходит и Google, и ElevenLabs, и Speechify - это сигнал для всей индустрии.
Технически интересно архитектурное решение: 12.5 Hz речевой токенизатор с низкой частотой кадров снижает стоимость авторегрессивного декодирования, сохраняя при этом информацию о содержании и голосе. Пятиэтапная схема обучения - от предобучения LM и FM-компонентов до отдельного RL для каждого из них - явно дает результат в качестве, хотя и не решает проблему скорости.
Если Alibaba в следующей версии подтянет throughput хотя бы до уровня Simba 3.2, у конкурентов начнутся серьезные проблемы. Пока же это история о том, как можно быть лучшим по качеству и при этом оставаться в хвосте по производительности - классический компромисс, с которым рынок TTS разбирается уже не первый год.
Информация о выходе модели и ее позиции в рейтингах подтверждена несколькими независимыми публикациями.
Источники
Похожие новости
Microsoft выпустила голосовые модели: транскрипция за 100 мс и клонирование голоса
Microsoft AI представила MAI-Transcribe-2-Streaming и две TTS-модели серии MAI-Voice-2.1 в режиме public preview. Первые результаты транскрипции - уже через 100 миллисекунд, поддержка 60 языков.
Nvidia выпустила бесплатную модель: восемь голосов в реальном времени
Nvidia открыла веса Nemotron 3 Diarization - 100-миллионная модель различает до восьми говорящих в прямом эфире с рекордно низкой ошибкой 14,7%.
Gemini сам позвонит в ресторан вместо вас: новая функция Pixel 11
Google запустила "Call for Me" для Pixel 11 - Gemini теперь звонит в компании сам, ждет на удержании и ведет разговор, пока вы наблюдаете за транскриптом.