A
ГолосAlibabaQwen AudioTTSсинтез речиSpeech Arena

Qwen Audio 3.0 TTS Plus от Alibaba возглавил мировой рейтинг голосовых ИИ

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Qwen Audio 3.0 TTS Plus от Alibaba возглавил мировой рейтинг голосовых ИИ

Когда Alibaba тихо выкатывает новую TTS-модель, это редко остается незамеченным. Qwen-Audio-3.0-TTS-Plus не просто вышел - он сразу занял первое место в независимом рейтинге Artificial Analysis Speech Arena, обогнав всех ключевых игроков рынка синтеза речи. Это не маркетинговое заявление самой компании, а результат независимого бенчмарка, что делает победу куда весомее.

Кто и на сколько проиграл

Цифры говорят сами за себя. Qwen-Audio-3.0-TTS-Plus набрал 1236 Elo-очков, оставив позади SpeechifyAI Simba 3.2 с результатом 1234 - разрыв минимальный, буквально два балла. Дальше идут Gemini 3.1 Flash TTS (1214) и Sonic 3.5 (1207). Разрыв между лидером и четвертым местом - почти 30 очков, что в Elo-системе уже ощутимо.

По критерию разборчивости речи модель также показывает сильные результаты: средний показатель WER/CER у Flash-версии составляет 3.87, у Plus - 3.96 (чем ниже, тем лучше). Это лучшие значения среди конкурентов в 10 из 16 поддерживаемых языков. По сходству с голосом-образцом Plus занимает первое место с показателем 82.75 из 100 по всем 16 языкам.

Два варианта - две задачи

Алибаба выпустила модель в двух конфигурациях с четкой специализацией. Flash заточен под реалтайм-взаимодействие: задержка первого пакета - около 300 миллисекунд, что вполне приемлемо для голосовых ассистентов и диалоговых систем. Plus ориентирован на максимальное качество - там важна естественность интонации и точная передача тембра голоса.

Оба варианта доступны исключительно как облачный сервис через Alibaba Cloud Model Studio - никаких скачиваемых весов нет. API работает по двустороннему WebSocket-протоколу, поддерживает форматы PCM, WAV, MP3 и Opus, а максимальная частота дискретизации - 48 кГц. SDK предоставляется для Python, Java, Go, C#, PHP и Node.js, с поддержкой Singapore и Beijing регионов.

16 языков и 86 тегов эмоций

Языковое покрытие - одна из сильных сторон модели. Поддерживаются 16 языков: арабский, китайский, английский, французский, немецкий, индонезийский, итальянский, японский, корейский, малайский, португальский, русский, испанский, тагальский, тайский и вьетнамский. Семь из них добавлены впервые по сравнению с предыдущим поколением. Отдельно охвачены 20 диалектных регионов китайского языка - что для глобального рынка может быть неочевидной, но критически важной деталью.

Для разработчиков, которым нужен тонкий контроль над интонацией, предусмотрены 86 инлайн-тегов. Они делятся на два типа. Управляющие теги - `[excited]`, `[sad]`, `[whispers]`, `[asmr]` - задают эмоциональный тон на весь последующий текст до следующего тега. Теги событий - `[laughing]`, `[gasp]`, `[clears throat]` - вставляют одиночный невербальный звук, не меняя общей интонации. Выглядит это примерно так: `[excited]Какой прекрасный день![laughing]Давайте выйдем погулять!` Для подкастов, аудиокниг и интерактивных NPC в играх - это серьезный инструмент.

Клонирование голоса тоже прокачали: модель лучше справляется с зашумленными или эхо-содержащими записями-образцами, что снимает одно из главных ограничений предыдущих версий.

Ахиллесова пята: скорость

Вот здесь все не так радужно. Qwen-Audio-3.0-TTS-Plus генерирует всего 16 символов в секунду - и это катастрофически мало на фоне конкурентов. Sonic 3.5 выдает 120 символов в секунду, Simba 3.2 - 30.2 символа в секунду. То есть по скорости Alibaba отстает от лидера в 7,5 раз.

Для приложений с реалтайм-требованиями это серьезный барьер. Можно занять первое место в рейтинге качества, но если синтез длинного текста занимает минуты, а не секунды - многие сценарии просто отпадают. Показательно, что сам Alibaba разделил продукт на Flash и Plus именно потому, что Plus в реалтайм не годится.

Цена и доступность

Ценообразование: $27.60 за миллион символов через Alibaba Cloud Model Studio. Для сравнения - это средний ценовой диапазон для топовых TTS-сервисов. ElevenLabs на своих корпоративных планах берет сопоставимо, Google Cloud TTS в зависимости от голоса обходится дешевле на стандартных, но дороже на премиальных.

Для российской аудитории ситуация привычная: сервис работает через Alibaba Cloud, российские карты туда не принимаются, потребуется зарубежная карта или виртуальный счет. Технически доступ возможен, но с рядом ограничений - как у большинства западных и азиатских облачных платформ.

Что это значит для рынка

Победа в рейтинге Artificial Analysis - это не просто строчка в пресс-релизе. Speech Arena использует Elo-систему, аналогичную той, что применяется для оценки языковых моделей в Chatbot Arena, то есть оценки дают реальные пользователи в слепых тестах. Когда модель Alibaba обходит и Google, и ElevenLabs, и Speechify - это сигнал для всей индустрии.

Технически интересно архитектурное решение: 12.5 Hz речевой токенизатор с низкой частотой кадров снижает стоимость авторегрессивного декодирования, сохраняя при этом информацию о содержании и голосе. Пятиэтапная схема обучения - от предобучения LM и FM-компонентов до отдельного RL для каждого из них - явно дает результат в качестве, хотя и не решает проблему скорости.

Если Alibaba в следующей версии подтянет throughput хотя бы до уровня Simba 3.2, у конкурентов начнутся серьезные проблемы. Пока же это история о том, как можно быть лучшим по качеству и при этом оставаться в хвосте по производительности - классический компромисс, с которым рынок TTS разбирается уже не первый год.

Информация о выходе модели и ее позиции в рейтингах подтверждена несколькими независимыми публикациями.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости