T
ГолосTencentGanderголосовой ИИHunyuanагентный ИИ

Tencent Gander: ИИ-ассистент, который работает и болтает одновременно

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения

Большинство голосовых ассистентов работают как рация: ты говоришь - они слушают, они говорят - ты ждешь. Tencent решила сломать эту схему. Команда Hunyuan Speech совместно с несколькими университетскими группами опубликовала техническое описание модели Gander - системы, которая буквально умеет одновременно разговаривать и делать дело.

Два компонента вместо одного перегруженного

Архитектурное решение в Gander простое и при этом нетривиальное. Разработчики разделили систему на два модуля, назвав их в анатомических терминах: "мозжечок" (cerebellum) и "мозг" (brain).

"Мозжечок" занимается разговором в режиме реального времени. Он нарезает диалог на односекундные отрезки и каждый раз решает: слушать, говорить или замолчать, если пользователь перебил. Никакого отдельного модуля для распознавания начала и конца речи - система обходится контекстом примерно последних двух минут разговора.

"Мозг" при этом работает в фоне: ищет файлы, правит код, ждет нужного слайда в презентации. Ключевая деталь - этот компонент можно менять, не переобучая разговорную часть. В тестах его роль играла неназванная модель из семейства GPT-5.6, но архитектура допускает подключение Codex, Claude Code или другого агента.

Практический смысл такого разделения очевиден: не надо заставлять один и тот же трансформер одновременно отвечать мгновенно и думать медленно. Это противоречие убивает либо скорость, либо качество рассуждений.

Что умеет на практике

Gander принимает на вход речь, изображения и текст одновременно. Пользователь может прервать систему в любой момент - фоновая задача при этом не сбрасывается. Для примера: агент исправляет баг, а пользователь в процессе добавляет требование совместимости с Python 3.12. Gander принимает уточнение и продолжает работу с учетом нового условия.

Система также сама инициирует коммуникацию - задает уточняющие вопросы или сообщает о прогрессе, не дожидаясь явного запроса от пользователя.

Цифры тестов: хорошие новости и плохие

Для оценки тайминга использовался Full-Duplex-Bench v3 - бенчмарк, тестирующий голосовых ассистентов в разных сценариях задач. Результаты по вмешательству в речь пользователя:

- Gander перебивал в 8% случаев из 100 тестовых сценариев - GPT-Realtime - в 13,5% случаев - Слабейший из конкурентов - почти в 48% случаев

По этому показателю Gander лучший среди протестированных систем, включая GPT-Realtime, Gemini Live и Grok. При этом Tencent честно признает: точность выполнения задач у Gander - худший результат среди всех сравниваемых систем. Авторы отчета объясняют это частично тем, что бенчмарк оценивает систему целиком, и ошибки распознавания речи тоже идут в минус. Когда "мозгу" подают транскрипт напрямую, результат заметно выше. Понимание видео и аудио тоже пока проседает.

Это типичный компромисс для систем, оптимизированных под разговорный ритм. Когда главная метрика - не перебивать человека, что-то другое неизбежно теряется. Вопрос в том, насколько критична эта потеря в реальных сценариях использования.

Сравнение с тем, что уже есть

GPT-4o в режиме реального времени, Gemini Live и голосовой режим Claude - все они так или иначе решают ту же проблему: как сделать разговор с ИИ менее похожим на звонок по спутниковой связи с задержкой. Но ни один из них не публиковал такой явной архитектурной развязки между разговорным и агентным компонентами.

Подход Gander интереснее всего тем, что "мозг" можно заменить. Это означает: когда выйдет более сильный агент для написания кода - его можно просто подключить к уже обученному разговорному модулю. Не нужно переобучать всю систему с нуля. Для компании, которая регулярно обновляет линейку Hunyuan, это логичное архитектурное решение.

Открытый код и доступность

Гитхаб-репозиторий с кодом уже существует, веса модели опубликованы на Hugging Face. Команда также объявила о планах выложить обучающие данные - сроки пока не названы.

Для российских разработчиков: GitHub и Hugging Face доступны без ограничений, так что развернуть модель локально уже можно.

Что это меняет

Gander показывает направление, в котором движется голосовой ИИ. Системы типа "спросил - подождал - получил ответ" уходят. На смену приходят агенты, которые работают параллельно с разговором, принимают уточнения на лету и сами сообщают о прогрессе.

Пока точность задач у Gander проседает - это честное ограничение первой версии. Но архитектурная идея сменного "мозга" выглядит продуманно: система будет становиться точнее по мере того, как будут улучшаться агентные модели, без необходимости переобучать разговорный компонент.

Информация о Gander подтверждена несколькими независимыми публикациями.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости