Microsoft выпустила голосовые модели: транскрипция за 100 мс и клонирование голоса

Пока ElevenLabs и OpenAI делят рынок голосовых агентов, Microsoft выпустила сразу три модели в режиме public preview через Microsoft Foundry.
MAI-Transcribe-2-Streaming: первый результат быстрее, чем вы успеваете закончить фразу
Модель транскрипции MAI-Transcribe-2-Streaming выдает первые частичные результаты чуть больше чем через 100 миллисекунд. Это про то, что голосовой агент может начать формировать ответ, пока пользователь еще говорит. Разница между "робот ждет паузы" и "робот слышит тебя в реальном времени" - именно здесь.
По заявлению Microsoft, модель занимает первое место по точности на платформе Artificial Analysis. Поддерживается 60 языков, включая русский. До конца года действует вводная цена: $0.54 за час аудио. Для сравнения - Whisper Large v3 от OpenAI через сторонние хостинги обходится примерно в $0.36-0.50 за час, но там нет стриминга с такой задержкой. Так что Microsoft берет не демпингом, а архитектурой.
Два голоса вместо одного: MAI-Voice-2.1 и Flash-вариант
С текстом-в-речь история интереснее. Microsoft выпустила MAI-Voice-2.1 - модель, которая говорит на 23 языках с нативным акцентом в каждом. Это не переключение голосов, а один и тот же голос, адаптированный под фонетику конкретного языка. Для разработчиков многоязычных продуктов это снимает головную боль с синхронизацией тембра между локализациями.
MAI-Voice-2.1-Flash - урезанный по цене вариант с задержкой 150 миллисекунд и стоимостью $15 за миллион символов против $22 у полной версии. Разница в 32% - это существенно при больших объемах. Обе модели доступны через Microsoft Foundry и MAI Playground, а голосовые модели - также на OpenRouter.
Отдельная деталь, которая одновременно впечатляет и настораживает: обе голосовые модели клонируют голос из нескольких секунд референсного аудио. Microsoft говорит о встроенных защитах от злоупотреблений, но конкретику не раскрывает. Судя по тому, как это работает у конкурентов - ElevenLabs требует верификацию, Resemble AI использует водяные знаки - скорее всего речь о чем-то похожем.
В тесте с 4000 участниками около половины сочли голоса принадлежащими реальному человеку. Это уже не "звучит как робот" - это практически паритет с реальностью.
Что это значит для рынка
Microsoft последовательно собирает стек для голосовых агентов под одной крышей. Транскрипция, синтез речи, языковая модель - все через Azure и Foundry. Стратегия понятна: не продавать один инструмент, а продавать инфраструктуру целиком.
ElevenLabs пока выигрывает по качеству клонирования и библиотеке готовых голосов - там тысячи пресетов, сообщество, маркетплейс. У Microsoft этого нет. Зато есть корпоративная инфраструктура, SLA, соответствие требованиям по безопасности и прямая интеграция с Azure. Для энтерпрайза, который строит колл-центр или систему уведомлений, выбор между ElevenLabs и Microsoft - это во многом выбор между стартапом и корпоративным вендором.
AssemblyAI и Deepgram в сегменте транскрипции держат сильные позиции по точности и задержкам. Но если Microsoft действительно занимает первое место на Artificial Analysis - это уже прямой конкурент.
Русский язык и доступность
Русский язык входит в число поддерживаемых 60 языков для транскрипции. Модели доступны через Microsoft Foundry в режиме public preview, голосовые модели - также на OpenRouter. Насколько хорошо MAI-Transcribe-2-Streaming справляется с акцентами и разговорной речью на русском - это вопрос, который стоит проверить практически, а не верить маркетинговым заявлениям.
Итого
Microsoft выпустила не прорыв, а плотно скомпонованный пакет инструментов с конкретными числами: 100 мс на первый результат транскрипции, 150 мс задержка у Flash-TTS, $0.54 за час аудио до конца года. Для разработчиков голосовых агентов это повод как минимум запустить бенчмарк - особенно если уже сидят на Azure.
Информация о выпуске подтверждена несколькими независимыми публикациями.
Источники
Похожие новости
Nvidia выпустила бесплатную модель: восемь голосов в реальном времени
Nvidia открыла веса Nemotron 3 Diarization - 100-миллионная модель различает до восьми говорящих в прямом эфире с рекордно низкой ошибкой 14,7%.
Gemini сам позвонит в ресторан вместо вас: новая функция Pixel 11
Google запустила "Call for Me" для Pixel 11 - Gemini теперь звонит в компании сам, ждет на удержании и ведет разговор, пока вы наблюдаете за транскриптом.
Tencent Gander: ИИ-ассистент, который работает и болтает одновременно
Tencent представила Gander - голосового агента с раздельной архитектурой "мозжечок/мозг", который ведет диалог в реальном времени, пока фоновый агент пишет код или ищет файлы.