xAI запустила голосовые API Grok: речь в текст и текст в речь

Маск идет на рынок голоса
Когда xAI только анонсировала Grok Voice для мобильных приложений, многие восприняли это как очередную игрушку в экосистеме Маска. Но теперь картина резко изменилась: компания выкатила два самостоятельных API - Speech-to-Text и Text-to-Speech - и прямым текстом заявляет, что метит в корпоративный сегмент. Это уже не фича для пользователей X, это инфраструктурный продукт для разработчиков.
Что здесь цепляет больше всего - оба API построены на той же инфраструктуре, которая уже работает в реальных продуктах: Grok на смартфонах, голосовые системы Tesla и клиентская поддержка Starlink. То есть это не лабораторная разработка, которую наспех завернули в API.
Что умеет Grok STT
Начнем с распознавания речи. Grok STT поддерживает 25 языков, работает в двух режимах - пакетном (batch) для уже записанных файлов и потоковом (streaming) для транскрипции в реальном времени. Ценник: $0.10 за час в batch-режиме и $0.20 за час в streaming. На фоне рынка это выглядит конкурентно - особенно учитывая набор функций.
В комплекте идут временны́е метки на уровне отдельных слов, диаризация спикеров (то самое "кто что сказал"), поддержка многоканального аудио и умная нормализация текста. Последнее - недооцененная штука: система сама конвертирует "сто шестьдесят семь тысяч девятьсот восемьдесят три доллара и пятнадцать центов" в читаемый "$167,983.15". Для финансовых и юридических транскриптов это экономит часы ручной правки.
По форматам - 12 аудиоформатов: WAV, MP3, OGG, Opus, FLAC, AAC, MP4, M4A, MKV плюс три "сырых" формата (PCM, µ-law, A-law). Максимальный файл - 500 МБ на запрос. Покрывает практически любой реальный сценарий.
Цифры бенчмарков - и почему им стоит верить осторожно
XAI публикует сравнения с конкурентами, и цифры выглядят убедительно. На задаче распознавания сущностей в телефонных звонках - имена, номера счетов, даты - Grok STT показывает 5.0% ошибок против 12.0% у ElevenLabs, 13.5% у Deepgram и 21.3% у AssemblyAI. Это не просто "немного лучше" - это в 2-4 раза точнее.
Для видео и подкастов картина другая: Grok и ElevenLabs идут вровень - 2.4% ошибок, Deepgram дает 3.0%, AssemblyAI - 3.2%. На общих аудиобенчмарках xAI фиксирует 6.9% word error rate.
Моя оговорка: это внутренние тесты xAI, а не независимый аудит. История знает много случаев, когда лабораторные показатели расходились с production-реальностью. Тем не менее, если цифры по телефонным звонкам хотя бы наполовину соответствуют действительности, это серьезная заявка - колл-центры и CRM-интеграции будут смотреть на этот API очень внимательно.
Grok TTS: голос с характером
Теперь про синтез речи. Grok TTS стоит $15.00 за миллион символов. Поддерживается 20 языков, доступно пять голосов: Ara, Eve, Leo, Rex и Sal (по умолчанию - Eve).
Но главная изюминка - система speech tags. Разработчики могут буквально режиссировать речь: вставлять `[laugh]`, `[sigh]`, `[breath]` как инлайн-теги или оборачивать фрагменты в `
По техническим ограничениям: до 15,000 символов на REST-запрос, для длинного контента - WebSocket streaming без ограничений по длине, причем аудио начинает возвращаться еще до завершения обработки всего текста. Для генерации подкастов или озвучки длинных статей это принципиально важно.
Кому это реально нужно
Для бизнеса интереснее всего несколько сценариев. Колл-центры и CRM: если точность на телефонном аудио действительно такова, как заявляется, это прямая замена Deepgram в существующих пайплайнах. Голосовые агенты: связка STT + LLM Grok + TTS в одной экосистеме упрощает архитектуру и потенциально снижает задержки. Доступность и локализация: 20-25 языков при конкурентной цене делают API интересным для продуктов с международной аудиторией.
Контекст и мои выводы
XAI входит на рынок, где уже есть сильные игроки с годами данных и доверием разработчиков. ElevenLabs стал де-факто стандартом для качественного TTS, Deepgram держит корпоративный STT-сегмент, AssemblyAI популярен среди стартапов. Но у xAI есть два козыря.
Первый - интеграция с Grok LLM. Когда у тебя в одном API-ключе живут и языковая модель, и голосовые инструменты, это снижает операционную сложность для команд, которые строят голосовых агентов. Второй - реальный production-трафик за плечами: тот же стек уже работает в автомобилях Tesla и поддержке Starlink.
Мой прогноз: в течение полугода мы увидим, насколько заявленные бенчмарки выдерживают независимую проверку. Если STT-точность на телефонных звонках подтвердится - xAI получит серьезную долю корпоративного рынка. Если нет - останется еще одним игроком в переполненном поле. Рынок голосового ИИ сейчас достаточно большой, чтобы прокормить нескольких победителей, и xAI явно намерена стать одним из них.
Источники
Похожие новости
Nvidia выпустила бесплатную модель: восемь голосов в реальном времени
Nvidia открыла веса Nemotron 3 Diarization - 100-миллионная модель различает до восьми говорящих в прямом эфире с рекордно низкой ошибкой 14,7%.
Gemini сам позвонит в ресторан вместо вас: новая функция Pixel 11
Google запустила "Call for Me" для Pixel 11 - Gemini теперь звонит в компании сам, ждет на удержании и ведет разговор, пока вы наблюдаете за транскриптом.
Tencent Gander: ИИ-ассистент, который работает и болтает одновременно
Tencent представила Gander - голосового агента с раздельной архитектурой "мозжечок/мозг", который ведет диалог в реальном времени, пока фоновый агент пишет код или ищет файлы.