Microsoft
ГолосMicrosoft AIMAI-Transcribe-2-StreamingMAI-Voice-2.1TTSголосовые агенты

Microsoft выпустила голосовые модели: транскрипция за 100 мс и клонирование голоса

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·3 мин чтения
Microsoft выпустила голосовые модели: транскрипция за 100 мс и клонирование голоса

Пока ElevenLabs и OpenAI делят рынок голосовых агентов, Microsoft выпустила сразу три модели в режиме public preview через Microsoft Foundry.

MAI-Transcribe-2-Streaming: первый результат быстрее, чем вы успеваете закончить фразу

Модель транскрипции MAI-Transcribe-2-Streaming выдает первые частичные результаты чуть больше чем через 100 миллисекунд. Это про то, что голосовой агент может начать формировать ответ, пока пользователь еще говорит. Разница между "робот ждет паузы" и "робот слышит тебя в реальном времени" - именно здесь.

По заявлению Microsoft, модель занимает первое место по точности на платформе Artificial Analysis. Поддерживается 60 языков, включая русский. До конца года действует вводная цена: $0.54 за час аудио. Для сравнения - Whisper Large v3 от OpenAI через сторонние хостинги обходится примерно в $0.36-0.50 за час, но там нет стриминга с такой задержкой. Так что Microsoft берет не демпингом, а архитектурой.

Два голоса вместо одного: MAI-Voice-2.1 и Flash-вариант

С текстом-в-речь история интереснее. Microsoft выпустила MAI-Voice-2.1 - модель, которая говорит на 23 языках с нативным акцентом в каждом. Это не переключение голосов, а один и тот же голос, адаптированный под фонетику конкретного языка. Для разработчиков многоязычных продуктов это снимает головную боль с синхронизацией тембра между локализациями.

MAI-Voice-2.1-Flash - урезанный по цене вариант с задержкой 150 миллисекунд и стоимостью $15 за миллион символов против $22 у полной версии. Разница в 32% - это существенно при больших объемах. Обе модели доступны через Microsoft Foundry и MAI Playground, а голосовые модели - также на OpenRouter.

Отдельная деталь, которая одновременно впечатляет и настораживает: обе голосовые модели клонируют голос из нескольких секунд референсного аудио. Microsoft говорит о встроенных защитах от злоупотреблений, но конкретику не раскрывает. Судя по тому, как это работает у конкурентов - ElevenLabs требует верификацию, Resemble AI использует водяные знаки - скорее всего речь о чем-то похожем.

В тесте с 4000 участниками около половины сочли голоса принадлежащими реальному человеку. Это уже не "звучит как робот" - это практически паритет с реальностью.

Что это значит для рынка

Microsoft последовательно собирает стек для голосовых агентов под одной крышей. Транскрипция, синтез речи, языковая модель - все через Azure и Foundry. Стратегия понятна: не продавать один инструмент, а продавать инфраструктуру целиком.

ElevenLabs пока выигрывает по качеству клонирования и библиотеке готовых голосов - там тысячи пресетов, сообщество, маркетплейс. У Microsoft этого нет. Зато есть корпоративная инфраструктура, SLA, соответствие требованиям по безопасности и прямая интеграция с Azure. Для энтерпрайза, который строит колл-центр или систему уведомлений, выбор между ElevenLabs и Microsoft - это во многом выбор между стартапом и корпоративным вендором.

AssemblyAI и Deepgram в сегменте транскрипции держат сильные позиции по точности и задержкам. Но если Microsoft действительно занимает первое место на Artificial Analysis - это уже прямой конкурент.

Русский язык и доступность

Русский язык входит в число поддерживаемых 60 языков для транскрипции. Модели доступны через Microsoft Foundry в режиме public preview, голосовые модели - также на OpenRouter. Насколько хорошо MAI-Transcribe-2-Streaming справляется с акцентами и разговорной речью на русском - это вопрос, который стоит проверить практически, а не верить маркетинговым заявлениям.

Итого

Microsoft выпустила не прорыв, а плотно скомпонованный пакет инструментов с конкретными числами: 100 мс на первый результат транскрипции, 150 мс задержка у Flash-TTS, $0.54 за час аудио до конца года. Для разработчиков голосовых агентов это повод как минимум запустить бенчмарк - особенно если уже сидят на Azure.

Информация о выпуске подтверждена несколькими независимыми публикациями.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости