Nvidia
ГолосNvidiaNemotron 3 Diarizationдиаризацияраспознавание речиopen-source

Nvidia выпустила бесплатную модель: восемь голосов в реальном времени

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Nvidia выпустила бесплатную модель: восемь голосов в реальном времени

Среди всего шума вокруг больших языковых моделей и генерации изображений тихо вышел инструмент, который решает очень конкретную и давно болезненную задачу: кто именно говорит прямо сейчас. 23 сентября 2026 года Nvidia опубликовала открытые веса Nemotron 3 Diarization - модели диаризации на 100 миллионов параметров, которая в реальном времени разделяет аудиопоток на голоса до восьми участников разговора.

Что умеет модель и как она устроена

Технически это 31-слойный трансформер-энкодер с Rotary Positional Embeddings. Модель принимает моноаудио на частоте 16 кГц, нарезает его на 10-миллисекундные мел-спектрограммные фреймы и выдает матрицу T×8 с вероятностями активности каждого из восьми каналов. Порядок каналов зафиксирован по первому появлению голоса: кто первым заговорил, тот навсегда остается speaker_0. Это важная архитектурная деталь - никакой кластеризации эмбеддингов, никаких внешних баз голосовых отпечатков.

Для стриминга используется механизм из более раннего Streaming Sortformer: кэш в порядке появления и FIFO-очередь недавних фреймов. Это позволяет обрабатывать аудио произвольной длины без фиксированного лимита по времени.

Одна из главных особенностей - четыре профиля задержки в одном чекпойнте: 0,32 секунды, 0,64 секунды, 1,04 секунды и офлайн-режим с буфером 30,4 секунды. Разработчик выбирает профиль под конкретный запрос, не переразворачивая модель. Для голосового агента, который должен реагировать мгновенно, берешь 0,32 секунды. Для транскрипции совещания после его окончания - 30,4 секунды с максимальной точностью.

Цифры, которые говорят сами за себя

На публичном бенчмарке VoiceArena Diarization Benchmark v1 Nemotron 3 занимает первое место с DER 14,72%. Ближайший конкурент показывает 19,3% - разрыв серьезный. Предшественник, Streaming Sortformer, при буфере 1,04 секунды проигрывает в среднем 41% по восьми тестовым сценариям.

Benchmark строгий: перекрывающаяся речь засчитывается как ошибка, мельчайшие смещения на границах смены говорящего тоже идут в минус.

Конкретные числа по датасетам из карточки модели дают более детальную картину. На NOTSOFAR1 (однокнальные записи) - 11,00% против 30,49% у базовой линии в офлайн-режиме. На AMI Test SDM - 11,14% против 21,42%. На DIHARD III - 12,73% против 19,09%. Baseten в собственных тестах на AISHELL-4 при низкой задержке зафиксировал 9,8% против 27,2% у Streaming Sortformer v2.1. Это уже не постепенное улучшение, а смена порядка величин.

Скорость тоже впечатляет инженерно: на RTX PRO 5000 в офлайн-режиме модель обрабатывает аудио в 1340 раз быстрее реального времени в обычном режиме и в 4385 раз в скомпилированном. При задержке 0,32 секунды - 12,5 и 54 соответственно. Это коэффициенты для одного потока; данные о параллельной нагрузке относятся к отдельным тестам на RTX PRO 6000, о которых ниже.

Кому это нужно на практике

Believe это в первую очередь инструмент для всего, где разговаривают несколько человек: колл-центры, медицинские приемы, судебные заседания, подкасты, корпоративные совещания. В связке с ASR-системой вроде Parakeet модель производит транскрипты с метками говорящих - правда, анонимными ("speaker_2", "speaker_0"), без привязки к реальным именам.

Перекрывающаяся речь, тяжелый фоновый шум и реверберация повышают процент ошибок - модель честно об этом предупреждает. Но даже в сложных условиях она держится лучше конкурентов.

Believe Baseten запустил готовые пресеты: предзаписанная диаризация, стриминг и диаризованная транскрипция в реальном времени, все на одной RTX PRO 6000. По их данным, один такой GPU при профиле задержки 1,04 секунды выдерживает более 500 одновременных часовых стримов чистой диаризации; с добавленной транскрипцией - 190 стримов. Для бизнеса это означает очень низкую стоимость инференса.

Помимо диаризации, выходные данные модели можно использовать как сигнал для VAD (детекции речевой активности), эндпойнтинга и управления очередностью реплик в голосовых агентах. Это открывает интересный сценарий: модель работает не только как постпроцессинг транскриптов, но и как компонент реального диалогового управления.

Открытые веса и доступность

Веса опубликованы на Hugging Face и доступны бесплатно для коммерческого и некоммерческого использования. Это принципиально отличает ситуацию от, скажем, проприетарных решений в облаках крупных провайдеров, где диаризация либо недоступна, либо стоит отдельных денег.

Для российской аудитории: модель работает полностью локально, никаких API-ключей и подписок не нужно. Веса можно скачать с Hugging Face (VPN может понадобиться для доступа к самому сайту). Карточка модели перечисляет конкретные поддерживаемые GPU - перед развертыванием стоит свериться с ней.

Что это меняет в индустрии

Раньше диаризация строилась по схеме "сегментация + извлечение эмбеддингов + кластеризация" - три отдельных компонента, каждый со своими гиперпараметрами. Nemotron 3 заменяет этот пайплайн одним проходом через единую модель. Это не только удобнее, но и убирает накопление ошибок между этапами.

Meta Muse Voice Transcribe проигрывает Nemotron 3 на всех проверенных датасетах даже при ультранизкой задержке. Pyannote Community-1 держится лучше только на AMI. Для open-source экосистемы это сильный сигнал: Nvidia пришла в нишу, где раньше доминировали академические проекты и стартапы.

Подробности о модели подтверждены несколькими независимыми публикациями, включая технические разборы с собственными бенчмарками.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости