Tencent Gander: ИИ-ассистент, который работает и болтает одновременно
Большинство голосовых ассистентов работают как рация: ты говоришь - они слушают, они говорят - ты ждешь. Tencent решила сломать эту схему. Команда Hunyuan Speech совместно с несколькими университетскими группами опубликовала техническое описание модели Gander - системы, которая буквально умеет одновременно разговаривать и делать дело.
Два компонента вместо одного перегруженного
Архитектурное решение в Gander простое и при этом нетривиальное. Разработчики разделили систему на два модуля, назвав их в анатомических терминах: "мозжечок" (cerebellum) и "мозг" (brain).
"Мозжечок" занимается разговором в режиме реального времени. Он нарезает диалог на односекундные отрезки и каждый раз решает: слушать, говорить или замолчать, если пользователь перебил. Никакого отдельного модуля для распознавания начала и конца речи - система обходится контекстом примерно последних двух минут разговора.
"Мозг" при этом работает в фоне: ищет файлы, правит код, ждет нужного слайда в презентации. Ключевая деталь - этот компонент можно менять, не переобучая разговорную часть. В тестах его роль играла неназванная модель из семейства GPT-5.6, но архитектура допускает подключение Codex, Claude Code или другого агента.
Практический смысл такого разделения очевиден: не надо заставлять один и тот же трансформер одновременно отвечать мгновенно и думать медленно. Это противоречие убивает либо скорость, либо качество рассуждений.
Что умеет на практике
Gander принимает на вход речь, изображения и текст одновременно. Пользователь может прервать систему в любой момент - фоновая задача при этом не сбрасывается. Для примера: агент исправляет баг, а пользователь в процессе добавляет требование совместимости с Python 3.12. Gander принимает уточнение и продолжает работу с учетом нового условия.
Система также сама инициирует коммуникацию - задает уточняющие вопросы или сообщает о прогрессе, не дожидаясь явного запроса от пользователя.
Цифры тестов: хорошие новости и плохие
Для оценки тайминга использовался Full-Duplex-Bench v3 - бенчмарк, тестирующий голосовых ассистентов в разных сценариях задач. Результаты по вмешательству в речь пользователя:
- Gander перебивал в 8% случаев из 100 тестовых сценариев - GPT-Realtime - в 13,5% случаев - Слабейший из конкурентов - почти в 48% случаев
По этому показателю Gander лучший среди протестированных систем, включая GPT-Realtime, Gemini Live и Grok. При этом Tencent честно признает: точность выполнения задач у Gander - худший результат среди всех сравниваемых систем. Авторы отчета объясняют это частично тем, что бенчмарк оценивает систему целиком, и ошибки распознавания речи тоже идут в минус. Когда "мозгу" подают транскрипт напрямую, результат заметно выше. Понимание видео и аудио тоже пока проседает.
Это типичный компромисс для систем, оптимизированных под разговорный ритм. Когда главная метрика - не перебивать человека, что-то другое неизбежно теряется. Вопрос в том, насколько критична эта потеря в реальных сценариях использования.
Сравнение с тем, что уже есть
GPT-4o в режиме реального времени, Gemini Live и голосовой режим Claude - все они так или иначе решают ту же проблему: как сделать разговор с ИИ менее похожим на звонок по спутниковой связи с задержкой. Но ни один из них не публиковал такой явной архитектурной развязки между разговорным и агентным компонентами.
Подход Gander интереснее всего тем, что "мозг" можно заменить. Это означает: когда выйдет более сильный агент для написания кода - его можно просто подключить к уже обученному разговорному модулю. Не нужно переобучать всю систему с нуля. Для компании, которая регулярно обновляет линейку Hunyuan, это логичное архитектурное решение.
Открытый код и доступность
Гитхаб-репозиторий с кодом уже существует, веса модели опубликованы на Hugging Face. Команда также объявила о планах выложить обучающие данные - сроки пока не названы.
Для российских разработчиков: GitHub и Hugging Face доступны без ограничений, так что развернуть модель локально уже можно.
Что это меняет
Gander показывает направление, в котором движется голосовой ИИ. Системы типа "спросил - подождал - получил ответ" уходят. На смену приходят агенты, которые работают параллельно с разговором, принимают уточнения на лету и сами сообщают о прогрессе.
Пока точность задач у Gander проседает - это честное ограничение первой версии. Но архитектурная идея сменного "мозга" выглядит продуманно: система будет становиться точнее по мере того, как будут улучшаться агентные модели, без необходимости переобучать разговорный компонент.
Информация о Gander подтверждена несколькими независимыми публикациями.
Источники
Похожие новости
Nvidia выпустила бесплатную модель: восемь голосов в реальном времени
Nvidia открыла веса Nemotron 3 Diarization - 100-миллионная модель различает до восьми говорящих в прямом эфире с рекордно низкой ошибкой 14,7%.
Gemini сам позвонит в ресторан вместо вас: новая функция Pixel 11
Google запустила "Call for Me" для Pixel 11 - Gemini теперь звонит в компании сам, ждет на удержании и ведет разговор, пока вы наблюдаете за транскриптом.
Apple переписала Siri на базе Gemini - но не для iPhone и iPad в Европе
После многолетних задержек Apple выпустила полностью переработанного Siri на движке Google Gemini. Европейские пользователи iPhone и iPad не получат его при выходе iOS 27 и iPadOS 27 из-за разногласий с регуляторами ЕС - хотя на macOS 27 и visionOS 27 доступ будет.