Nvidia выпустила бесплатную модель: восемь голосов в реальном времени

Среди всего шума вокруг больших языковых моделей и генерации изображений тихо вышел инструмент, который решает очень конкретную и давно болезненную задачу: кто именно говорит прямо сейчас. 23 сентября 2026 года Nvidia опубликовала открытые веса Nemotron 3 Diarization - модели диаризации на 100 миллионов параметров, которая в реальном времени разделяет аудиопоток на голоса до восьми участников разговора.
Что умеет модель и как она устроена
Технически это 31-слойный трансформер-энкодер с Rotary Positional Embeddings. Модель принимает моноаудио на частоте 16 кГц, нарезает его на 10-миллисекундные мел-спектрограммные фреймы и выдает матрицу T×8 с вероятностями активности каждого из восьми каналов. Порядок каналов зафиксирован по первому появлению голоса: кто первым заговорил, тот навсегда остается speaker_0. Это важная архитектурная деталь - никакой кластеризации эмбеддингов, никаких внешних баз голосовых отпечатков.
Для стриминга используется механизм из более раннего Streaming Sortformer: кэш в порядке появления и FIFO-очередь недавних фреймов. Это позволяет обрабатывать аудио произвольной длины без фиксированного лимита по времени.
Одна из главных особенностей - четыре профиля задержки в одном чекпойнте: 0,32 секунды, 0,64 секунды, 1,04 секунды и офлайн-режим с буфером 30,4 секунды. Разработчик выбирает профиль под конкретный запрос, не переразворачивая модель. Для голосового агента, который должен реагировать мгновенно, берешь 0,32 секунды. Для транскрипции совещания после его окончания - 30,4 секунды с максимальной точностью.
Цифры, которые говорят сами за себя
На публичном бенчмарке VoiceArena Diarization Benchmark v1 Nemotron 3 занимает первое место с DER 14,72%. Ближайший конкурент показывает 19,3% - разрыв серьезный. Предшественник, Streaming Sortformer, при буфере 1,04 секунды проигрывает в среднем 41% по восьми тестовым сценариям.
Benchmark строгий: перекрывающаяся речь засчитывается как ошибка, мельчайшие смещения на границах смены говорящего тоже идут в минус.
Конкретные числа по датасетам из карточки модели дают более детальную картину. На NOTSOFAR1 (однокнальные записи) - 11,00% против 30,49% у базовой линии в офлайн-режиме. На AMI Test SDM - 11,14% против 21,42%. На DIHARD III - 12,73% против 19,09%. Baseten в собственных тестах на AISHELL-4 при низкой задержке зафиксировал 9,8% против 27,2% у Streaming Sortformer v2.1. Это уже не постепенное улучшение, а смена порядка величин.
Скорость тоже впечатляет инженерно: на RTX PRO 5000 в офлайн-режиме модель обрабатывает аудио в 1340 раз быстрее реального времени в обычном режиме и в 4385 раз в скомпилированном. При задержке 0,32 секунды - 12,5 и 54 соответственно. Это коэффициенты для одного потока; данные о параллельной нагрузке относятся к отдельным тестам на RTX PRO 6000, о которых ниже.
Кому это нужно на практике
Believe это в первую очередь инструмент для всего, где разговаривают несколько человек: колл-центры, медицинские приемы, судебные заседания, подкасты, корпоративные совещания. В связке с ASR-системой вроде Parakeet модель производит транскрипты с метками говорящих - правда, анонимными ("speaker_2", "speaker_0"), без привязки к реальным именам.
Перекрывающаяся речь, тяжелый фоновый шум и реверберация повышают процент ошибок - модель честно об этом предупреждает. Но даже в сложных условиях она держится лучше конкурентов.
Believe Baseten запустил готовые пресеты: предзаписанная диаризация, стриминг и диаризованная транскрипция в реальном времени, все на одной RTX PRO 6000. По их данным, один такой GPU при профиле задержки 1,04 секунды выдерживает более 500 одновременных часовых стримов чистой диаризации; с добавленной транскрипцией - 190 стримов. Для бизнеса это означает очень низкую стоимость инференса.
Помимо диаризации, выходные данные модели можно использовать как сигнал для VAD (детекции речевой активности), эндпойнтинга и управления очередностью реплик в голосовых агентах. Это открывает интересный сценарий: модель работает не только как постпроцессинг транскриптов, но и как компонент реального диалогового управления.
Открытые веса и доступность
Веса опубликованы на Hugging Face и доступны бесплатно для коммерческого и некоммерческого использования. Это принципиально отличает ситуацию от, скажем, проприетарных решений в облаках крупных провайдеров, где диаризация либо недоступна, либо стоит отдельных денег.
Для российской аудитории: модель работает полностью локально, никаких API-ключей и подписок не нужно. Веса можно скачать с Hugging Face (VPN может понадобиться для доступа к самому сайту). Карточка модели перечисляет конкретные поддерживаемые GPU - перед развертыванием стоит свериться с ней.
Что это меняет в индустрии
Раньше диаризация строилась по схеме "сегментация + извлечение эмбеддингов + кластеризация" - три отдельных компонента, каждый со своими гиперпараметрами. Nemotron 3 заменяет этот пайплайн одним проходом через единую модель. Это не только удобнее, но и убирает накопление ошибок между этапами.
Meta Muse Voice Transcribe проигрывает Nemotron 3 на всех проверенных датасетах даже при ультранизкой задержке. Pyannote Community-1 держится лучше только на AMI. Для open-source экосистемы это сильный сигнал: Nvidia пришла в нишу, где раньше доминировали академические проекты и стартапы.
Подробности о модели подтверждены несколькими независимыми публикациями, включая технические разборы с собственными бенчмарками.
Источники
Похожие новости
Microsoft выпустила голосовые модели: транскрипция за 100 мс и клонирование голоса
Microsoft AI представила MAI-Transcribe-2-Streaming и две TTS-модели серии MAI-Voice-2.1 в режиме public preview. Первые результаты транскрипции - уже через 100 миллисекунд, поддержка 60 языков.
Gemini сам позвонит в ресторан вместо вас: новая функция Pixel 11
Google запустила "Call for Me" для Pixel 11 - Gemini теперь звонит в компании сам, ждет на удержании и ведет разговор, пока вы наблюдаете за транскриптом.
Tencent Gander: ИИ-ассистент, который работает и болтает одновременно
Tencent представила Gander - голосового агента с раздельной архитектурой "мозжечок/мозг", который ведет диалог в реальном времени, пока фоновый агент пишет код или ищет файлы.