Grok Voice Think Fast 1.0: голосовой ИИ от xAI, который думает на ходу

Когда голосовой ИИ наконец-то научился слушать
Я слежу за развитием голосовых ИИ-агентов уже несколько лет, и большинство из них напоминают неловкого стажера на первом звонке: либо перебивают не вовремя, либо зависают на полуслове, либо теряют нить разговора после третьего уточнения. xAI, судя по всему, решила эту задачу не косметически, а архитектурно - и числа, которые компания публикует для своей новой модели Grok Voice Think Fast 1.0, заставляют относиться к этому заявлению всерьез.
Что именно выпустила xAI
Grok Voice Think Fast 1.0 - это флагманская голосовая модель xAI, доступная через API компании. Она позиционируется как полнодуплексный голосовой агент: система одновременно обрабатывает входящую речь и генерирует ответ, не дожидаясь паузы собеседника. Именно так устроено живое человеческое общение - и именно поэтому прерывания, фоновый шум, акценты и незаконченные фразы являются настоящим испытанием для любой подобной системы.
Модель ориентирована на сценарии клиентской поддержки, телефонных продаж, записи на прием, бронирования ресторанов и другие корпоративные применения. Поддерживается 25 языков - это серьезная заявка на глобальное корпоративное применение. Русский язык в списке официально не подтвержден, но 25 языков - это уже не "английский плюс несколько европейских".
Цифры, которые сложно проигнорировать
Основной бенчмарк - τ-voice Bench (tau-voice Bench) - специально разработан для оценки голосовых агентов в реалистичных условиях: шум, акценты, перебивания, естественная смена ролей в диалоге. Это принципиально важно: большинство традиционных ASR-тестов проводятся на чистом аудио, что мало коррелирует с реальными звонками.
Итоговый рейтинг выглядит так: - Grok Voice Think Fast 1.0 - 67,3% - Gemini 3.1 Flash Live - 43,8% - Grok Voice Fast 1.0 (предыдущая модель xAI) - 38,3% - GPT Realtime 1.5 - 35,3%
Разрыв между лидером и ближайшим конкурентом - более 23 процентных пунктов. Это не "немного лучше", это другой класс.
По вертикалям картина еще показательнее. В телекоме - сценарии смены тарифа, споры по счетам, техническая поддержка - Grok Voice Think Fast 1.0 набирает 73,7%, тогда как Gemini 3.1 Flash Live остается на уровне 21,9%, а GPT Realtime 1.5 - на 21,1%. Разрыв с ближайшим конкурентом составляет более 51 процентного пункта в одной вертикали - это уже не вопрос тонкой настройки, это принципиально иная архитектура.
В авиационном сегменте (изменение бронирований, задержки, сложные маршруты): 66% против 40% у Gemini и 36% у GPT Realtime. В ритейле: 62,3% против 44,7% и 38,6% соответственно.
Фокус с латентностью: думать, не замолкая
Самое технически интересное в этой модели - способ работы с reasoning. Традиционные рассуждающие модели генерируют промежуточные "мысли" перед финальным ответом, что увеличивает задержку. Grok Voice Think Fast 1.0 выполняет рассуждение в фоне, не добавляя паузы к голосовому ответу.
Для инженерных команд, которые строят голосовых агентов, это означает качество reasoning-модели при задержке быстрой модели. Скрыть вычислительную нагрузку от пользовательского опыта - задача нетривиальная, и если xAI действительно решила ее без компромиссов по точности, это серьезное архитектурное достижение.
Starlink уже использует - и это многое говорит
Ключевой индикатор реальной ценности продукта - не бенчмарки, а продакшн-деплой. По данным xAI, Grok Voice обеспечивает телефонные продажи и клиентскую поддержку Starlink по номеру +1 (888) GO STARLINK. Модель достигает 70% автономного разрешения обращений - то есть в семи из десяти случаев проблема закрывается без участия живого оператора.
Масштаб деплоя сам по себе является аргументом: один агент использует 28 инструментов в сотнях сценариев поддержки и продаж, самостоятельно выполняет диагностику оборудования, инициирует замену устройств и выдает сервисные кредиты.
Что это значит для рынка голосового ИИ
До сих пор рынок корпоративных голосовых агентов делился между несколькими игроками: ElevenLabs (синтез речи), Deepgram (транскрипция), различные сборки на базе GPT-4o Realtime. Grok Voice Think Fast 1.0 претендует на то, чтобы стать единой точкой входа для сложных многоходовых голосовых сценариев.
Для разработчиков это потенциально упрощает архитектуру: меньше интеграций, меньше точек отказа, единый API. Для бизнеса - снижение стоимости разработки и обслуживания голосовых решений. Для конкурентов - серьезный сигнал: GPT Realtime 1.5 отстает от лидера более чем вдвое (35,3% против 67,3%), Gemini 3.1 Flash Live - примерно в 1,5 раза (43,8% против 67,3%).
Мой вывод
Grok Voice Think Fast 1.0 - это первая голосовая модель за долгое время, которая меняет расстановку сил, а не просто добавляет еще одну строчку в сравнительную таблицу. Разрыв с конкурентами на τ-voice Bench слишком большой, чтобы списать его на особенности бенчмарка. Деплой на Starlink с 70% автономным разрешением - слишком конкретный результат, чтобы игнорировать.
OpenAI и Google теперь знают, что им нужно догонять. Интересный вопрос - насколько быстро.
*Информация подтверждена несколькими независимыми публикациями в профильных изданиях.*
Похожие новости
Nvidia выпустила бесплатную модель: восемь голосов в реальном времени
Nvidia открыла веса Nemotron 3 Diarization - 100-миллионная модель различает до восьми говорящих в прямом эфире с рекордно низкой ошибкой 14,7%.
Gemini сам позвонит в ресторан вместо вас: новая функция Pixel 11
Google запустила "Call for Me" для Pixel 11 - Gemini теперь звонит в компании сам, ждет на удержании и ведет разговор, пока вы наблюдаете за транскриптом.
Tencent Gander: ИИ-ассистент, который работает и болтает одновременно
Tencent представила Gander - голосового агента с раздельной архитектурой "мозжечок/мозг", который ведет диалог в реальном времени, пока фоновый агент пишет код или ищет файлы.