NVIDIA
ИИ-чатNVIDIAJetson AGX ThorTensorRT Edge-LLMMLPerfагентный ИИ

Jetson AGX Thor обогнал llama.cpp в 6,4 раза на агентном ИИ-бенчмарке

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·5 мин чтения
Jetson AGX Thor обогнал llama.cpp в 6,4 раза на агентном ИИ-бенчмарке

Агентный ИИ выбирается из дата-центров

Есть ощущение, что гонка за производительностью больших языковых моделей постепенно перемещается с серверных стоек в совершенно другие места - в роботов, автомобили, промышленные контроллеры. И именно здесь NVIDIA сделала неожиданно громкое заявление в рамках раунда MLPerf Inference v6.1.

На одном Jetson AGX Thor Developer Kit со 128 ГБ унифицированной памяти библиотека TensorRT Edge-LLM запустила модель Qwen3.6-27B и прошла весь агентный бенчмарк MLPerf Edge Agentic - все 1 007 диалоговых ходов - за 24 минуты 36 секунд. Референсный запуск на llama.cpp занял 2 часа 37 минут. Разница - 6,4 раза.

Цифра сама по себе впечатляет, но важнее понять, что именно измерялось.

Что такое агентный бенчмарк и почему он сложнее обычного

Стандартные тесты на скорость инференса проверяют простую вещь: насколько быстро модель генерирует токены в ответ на один запрос. Агентный сценарий устроен принципиально иначе. Модель получает задачу, выбирает инструмент, получает результат его работы, добавляет его в контекст и продолжает рассуждение - снова и снова, по кругу.

MLPerf Edge Agentic воспроизводит записанные траектории агента, решающего задачи в стиле software engineering. Контекст растет от хода к ходу и к концу достигает примерно 23 500 токенов. Это уже не чат-бот, отвечающий на один вопрос, - это полноценная рабочая сессия, где модель должна не просто генерировать, но и удерживать длинную историю разговора в памяти.

Точность при этом тоже проверяется: фаза accuracy использует промпты из Berkeley Function Calling Leaderboard v4 и оценивает, правильно ли модель выбирает функции, корректно ли формирует аргументы и не вызывает ли инструменты там, где они не нужны.

Четыре технических решения, которые дали результат

То, что NVIDIA выжала такую скорость из edge-устройства, - не магия. Под капотом четыре конкретных приема, каждый из которых дает свой вклад.

Первое - квантизация NVFP4 для весов и активаций плюс FP8 для KV-кеша. Это позволяет уместить 27-миллиардную модель в памяти устройства без критических потерь точности.

Второе - повторное использование KV-кеша между ходами агента. Поскольку каждый следующий ход включает всю предыдущую историю, значительная часть токенов промпта уже была обработана раньше. По данным NVIDIA, примерно 96% токенов промпта обслуживалось из горячего кеша, минуя повторный prefill.

Третье - древовидное предсказание нескольких токенов (tree-based MTP). Система проверяет 8 шагов вперед с деревом из 16 узлов и коэффициентом ветвления 2. Для задач с вызовом функций это дало прирост декодирования примерно +40% по сравнению с линейным MTP.

Четвертое - все вышеперечисленное работает на архитектуре Blackwell GPU внутри Jetson AGX Thor, которая физически поддерживает эти операции на аппаратном уровне.

Контекст: одновременно NVIDIA показала Vera Rubin NVL72

Тот же день, 16 сентября 2026, NVIDIA опубликовала результаты и для своего флагманского серверного решения - Vera Rubin NVL72. Там цифры другого масштаба: на Qwen3-VL система показала до 3,7x больший throughput по сравнению с GB300 NVL72, на DeepSeek-R1 - до 2,5x. На агентном бенчмарке SemiAnalysis AgentX Vera Rubin NVL72 в preview-тестировании обогнал GB300 NVL72 в 30 раз.

Это два разных сегмента рынка, которые NVIDIA закрывает одновременно. Vera Rubin - для дата-центров, где задача - максимальный throughput на стойку. Jetson AGX Thor - для устройств, где нет подключения к облаку или оно ненадежно.

Интересная деталь из результатов по GB300 NVL72: при масштабировании с одной стойки (72 GPU) до четырех (288 GPU) на задаче DeepSeek-R1 NVIDIA получила 99% эффективности масштабирования в offline-сценарии. Это почти линейный рост производительности с добавлением железа - редкость для распределенных систем.

Что это значит для разработчиков и бизнеса

Для разработчиков, которые строят агентные системы под edge-деплой, результат говорит о конкретном: 27-миллиардная модель на одном устройстве уже способна работать в реальном времени на агентных задачах без постоянной связи с сервером. Это открывает сценарии, которые раньше требовали либо облака, либо компромисса с размером модели.

Технически это доступно через ветку TensorRT Edge-LLM release/0.9.1-mlpinf - там опубликованы настройки экспорта модели, команды сборки движка и конфигурация сервера. Откалиброванный чекпоинт Qwen3.6-27B в формате NVFP4 можно скачать отдельно.

Для российских разработчиков: Jetson AGX Thor как железо доступен через официальных дистрибьюторов NVIDIA в РФ, хотя с логистикой и ценами ситуация нестабильна - стоит уточнять актуальность у конкретных поставщиков. TensorRT Edge-LLM как программный стек распространяется через репозиторий NVIDIA и формально не имеет региональных ограничений на скачивание.

Бенчмарки как сигнал о следующем шаге

Мне кажется, что сам факт появления MLPerf Edge Agentic как отдельной категории - более важный сигнал, чем конкретные цифры. MLCommons добавляет категории тогда, когда индустрия уже достаточно серьезно занялась направлением. Агентный инференс на edge-устройствах перестал быть исследовательской задачей и превратился в то, что нужно измерять стандартизированно.

NVIDIA также анонсировала будущий бенчмарк MLPerf Endpoints, который должен покрыть агентный инференс шире, чем нынешние throughput-ориентированные тесты. Это говорит о том, что текущий результат - не финальная точка, а начало серии измерений.

В раунде v6.1 участвовали 19 партнеров NVIDIA, из которых 8 подавали результаты на мультиузловых системах Blackwell NVL72 - среди них ASUS, Azure, CoreWeave, Dell Technologies, HPE, Lambda, Oracle Cloud Infrastructure и Supermicro. Такая широта участия означает, что экосистема вокруг этих результатов уже достаточно зрелая.

Информация подтверждена несколькими независимыми публикациями, вышедшими 16 сентября 2026 года.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости