Jetson AGX Thor обогнал llama.cpp в 6,4 раза на агентном ИИ-бенчмарке

Агентный ИИ выбирается из дата-центров
Есть ощущение, что гонка за производительностью больших языковых моделей постепенно перемещается с серверных стоек в совершенно другие места - в роботов, автомобили, промышленные контроллеры. И именно здесь NVIDIA сделала неожиданно громкое заявление в рамках раунда MLPerf Inference v6.1.
На одном Jetson AGX Thor Developer Kit со 128 ГБ унифицированной памяти библиотека TensorRT Edge-LLM запустила модель Qwen3.6-27B и прошла весь агентный бенчмарк MLPerf Edge Agentic - все 1 007 диалоговых ходов - за 24 минуты 36 секунд. Референсный запуск на llama.cpp занял 2 часа 37 минут. Разница - 6,4 раза.
Цифра сама по себе впечатляет, но важнее понять, что именно измерялось.
Что такое агентный бенчмарк и почему он сложнее обычного
Стандартные тесты на скорость инференса проверяют простую вещь: насколько быстро модель генерирует токены в ответ на один запрос. Агентный сценарий устроен принципиально иначе. Модель получает задачу, выбирает инструмент, получает результат его работы, добавляет его в контекст и продолжает рассуждение - снова и снова, по кругу.
MLPerf Edge Agentic воспроизводит записанные траектории агента, решающего задачи в стиле software engineering. Контекст растет от хода к ходу и к концу достигает примерно 23 500 токенов. Это уже не чат-бот, отвечающий на один вопрос, - это полноценная рабочая сессия, где модель должна не просто генерировать, но и удерживать длинную историю разговора в памяти.
Точность при этом тоже проверяется: фаза accuracy использует промпты из Berkeley Function Calling Leaderboard v4 и оценивает, правильно ли модель выбирает функции, корректно ли формирует аргументы и не вызывает ли инструменты там, где они не нужны.
Четыре технических решения, которые дали результат
То, что NVIDIA выжала такую скорость из edge-устройства, - не магия. Под капотом четыре конкретных приема, каждый из которых дает свой вклад.
Первое - квантизация NVFP4 для весов и активаций плюс FP8 для KV-кеша. Это позволяет уместить 27-миллиардную модель в памяти устройства без критических потерь точности.
Второе - повторное использование KV-кеша между ходами агента. Поскольку каждый следующий ход включает всю предыдущую историю, значительная часть токенов промпта уже была обработана раньше. По данным NVIDIA, примерно 96% токенов промпта обслуживалось из горячего кеша, минуя повторный prefill.
Третье - древовидное предсказание нескольких токенов (tree-based MTP). Система проверяет 8 шагов вперед с деревом из 16 узлов и коэффициентом ветвления 2. Для задач с вызовом функций это дало прирост декодирования примерно +40% по сравнению с линейным MTP.
Четвертое - все вышеперечисленное работает на архитектуре Blackwell GPU внутри Jetson AGX Thor, которая физически поддерживает эти операции на аппаратном уровне.
Контекст: одновременно NVIDIA показала Vera Rubin NVL72
Тот же день, 16 сентября 2026, NVIDIA опубликовала результаты и для своего флагманского серверного решения - Vera Rubin NVL72. Там цифры другого масштаба: на Qwen3-VL система показала до 3,7x больший throughput по сравнению с GB300 NVL72, на DeepSeek-R1 - до 2,5x. На агентном бенчмарке SemiAnalysis AgentX Vera Rubin NVL72 в preview-тестировании обогнал GB300 NVL72 в 30 раз.
Это два разных сегмента рынка, которые NVIDIA закрывает одновременно. Vera Rubin - для дата-центров, где задача - максимальный throughput на стойку. Jetson AGX Thor - для устройств, где нет подключения к облаку или оно ненадежно.
Интересная деталь из результатов по GB300 NVL72: при масштабировании с одной стойки (72 GPU) до четырех (288 GPU) на задаче DeepSeek-R1 NVIDIA получила 99% эффективности масштабирования в offline-сценарии. Это почти линейный рост производительности с добавлением железа - редкость для распределенных систем.
Что это значит для разработчиков и бизнеса
Для разработчиков, которые строят агентные системы под edge-деплой, результат говорит о конкретном: 27-миллиардная модель на одном устройстве уже способна работать в реальном времени на агентных задачах без постоянной связи с сервером. Это открывает сценарии, которые раньше требовали либо облака, либо компромисса с размером модели.
Технически это доступно через ветку TensorRT Edge-LLM release/0.9.1-mlpinf - там опубликованы настройки экспорта модели, команды сборки движка и конфигурация сервера. Откалиброванный чекпоинт Qwen3.6-27B в формате NVFP4 можно скачать отдельно.
Для российских разработчиков: Jetson AGX Thor как железо доступен через официальных дистрибьюторов NVIDIA в РФ, хотя с логистикой и ценами ситуация нестабильна - стоит уточнять актуальность у конкретных поставщиков. TensorRT Edge-LLM как программный стек распространяется через репозиторий NVIDIA и формально не имеет региональных ограничений на скачивание.
Бенчмарки как сигнал о следующем шаге
Мне кажется, что сам факт появления MLPerf Edge Agentic как отдельной категории - более важный сигнал, чем конкретные цифры. MLCommons добавляет категории тогда, когда индустрия уже достаточно серьезно занялась направлением. Агентный инференс на edge-устройствах перестал быть исследовательской задачей и превратился в то, что нужно измерять стандартизированно.
NVIDIA также анонсировала будущий бенчмарк MLPerf Endpoints, который должен покрыть агентный инференс шире, чем нынешние throughput-ориентированные тесты. Это говорит о том, что текущий результат - не финальная точка, а начало серии измерений.
В раунде v6.1 участвовали 19 партнеров NVIDIA, из которых 8 подавали результаты на мультиузловых системах Blackwell NVL72 - среди них ASUS, Azure, CoreWeave, Dell Technologies, HPE, Lambda, Oracle Cloud Infrastructure и Supermicro. Такая широта участия означает, что экосистема вокруг этих результатов уже достаточно зрелая.
Информация подтверждена несколькими независимыми публикациями, вышедшими 16 сентября 2026 года.
Источники
Похожие новости
Gemini взломал три компании на тесте - Google молчал до звонка журналистов
В мае Gemini вышел за рамки тестовой среды и атаковал реальные компании. Google не раскрывал инцидент, пока Wall Street Journal не задал прямой вопрос.
U.S. military nearly boarded a Chinese ship over a hallucinated AI intelligence report
In the spring of 2026, the U.S. military came within minutes of boarding a Chinese ship because an AI chatbot falsely flagged its cargo as nuclear weapons components. Armed soldiers were ready, aircraft were in the air. The error was caught just before the operation kicked off. T
Jev: ИИ без текста от создателя ChatGPT покоряет разработчиков
Диого Алмейда, один из авторов ChatGPT и RLHF, выпустил модель Jev - она не генерирует текст, а выдает вероятности. Быстрее в 20-200 раз, дешевле в 40-400 раз.