NVIDIA
Генерация кодаNVIDIAAVOARC-AGI-3агентный ИИClaude Opus 5

NVIDIA AVO: агентная система достигла 100% на ARC-AGI-3

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
NVIDIA AVO: агентная система достигла 100% на ARC-AGI-3

Когда модель - это только половина уравнения

Есть расхожее заблуждение в мире ИИ: чем мощнее языковая модель, тем умнее агент. NVIDIA только что публично разнесла этот миф в пыль. Их исследовательский проект AVO (Agentic Variation Operators) взял Claude Opus 5 - модель, которая сама по себе набирает 30% на бенчмарке ARC-AGI-3 - и в рамках агентной системы довела ее до 100% по метрике RHAE. Все 183 уровня, все 25 сред. Это не улучшение результата, это смена парадигмы.

Я слежу за развитием агентных систем уже несколько лет, и честно скажу: такой разрыв между "голой" моделью и системой с обвязкой я видел впервые. Тридцать процентов против ста - это не оптимизация, это другой класс задач.

Что такое AVO и почему это не очередной wrapper

AVO - это не просто "оборачиватель" вокруг LLM с красивым промптом. Архитектура построена на нескольких ключевых принципах, которые вместе дают качественный скачок.

Первое: персистентная память. Агент не начинает каждый шаг с чистого листа - он накапливает контекст, помнит что пробовал, что не сработало, какие гипотезы уже проверены. Звучит банально, но большинство существующих агентных систем эту проблему решают плохо.

Второе: супервизор, который следит за общей траекторией поиска. Если прогресс застрял, супервизор вмешивается и перенаправляет основного агента. Это имитирует то, как работают опытные инженеры: есть тот, кто делает, и есть тот, кто смотрит на картину в целом.

Третье: инструментальное использование без предопределенного сценария. Агент сам решает, что инспектировать, что менять, что тестировать - не по скрипту, а по ситуации.

GPU-оптимизация как первый полигон

Прежде чем AVO добралась до ARC-AGI-3, она прошла боевые испытания на задаче оптимизации GPU-ядер. Это одна из самых неблагодарных инженерных задач: пространство поиска огромное, интуиция не работает, каждый эксперимент требует реального железа.

AVO автономно исследовала более 500 направлений, зафиксировала 40 версий ядер и в итоге достигла производительности на 10,5% выше, чем FlashAttention-4 на системах NVIDIA DGX B200. Без ручного вмешательства. Это не демо на игрушечной задаче - FlashAttention-4 это серьезный технологический ориентир, над которым работали лучшие инженеры.

Для меня это самый впечатляющий результат во всей истории - даже более показательный, чем сотня процентов на бенчмарке. Потому что оптимизация GPU-ядер дает реальный экономический эффект прямо сейчас.

ARC-AGI-3: почему этот бенчмарк имеет значение

ARC-AGI-3 от команды Франсуа Шолле - это не очередной тест на знание фактов или решение математических задач. Он специально создан так, чтобы проверять способность к обобщению в условиях, которых модель не видела при обучении. 183 уровня, 25 различных сред - каждая требует адаптации, а не воспроизведения выученных паттернов.

Для сравнения: лучший предыдущий публичный результат принадлежал системе VISTA. AVO не просто превзошла его по счету - она сделала это, совершив на 12% меньше действий в среде. То есть не методом перебора, а более эффективным поведением. Это принципиальное различие.

Сами по себе модели GPT-4o, Claude 3.5 или Gemini 1.5 Pro на ARC-AGI-3 показывают скромные результаты именно потому, что задача требует не знаний, а архитектуры рассуждений. AVO это подтвердила экспериментально.

Что это меняет для разработчиков

Главный вывод для инженеров, строящих агентные системы: инвестиции в архитектуру агента могут окупаться сильнее, чем апгрейд базовой модели. Если ваш агент работает плохо, возможно проблема не в том, что вы используете GPT-4o вместо o3 - а в том, как вы управляете памятью, обратной связью и восстановлением после ошибок.

Практически это означает: прежде чем платить за более дорогую модель, разберитесь с системой вокруг нее. Persistent memory, supervision loop, structured tool use - это не "nice to have", это фундамент.

Для компаний, которые строят автономных агентов для длинных задач - кодогенерация, научные исследования, инженерные расчеты - работа NVIDIA дает конкретный архитектурный шаблон, а не абстрактные принципы.

Доступность и российский контекст

AVO пока остается исследовательским проектом NVIDIA, а не коммерческим продуктом. Публичного API нет, репозиторий на момент публикации закрытый. Для российских разработчиков прямой доступ к системе недоступен - как и к DGX B200, на которых проводились тесты.

Однако архитектурные принципы полностью открыты в публикации, и ничто не мешает воспроизвести их на открытых моделях. Тем более что Claude Opus 5, использованный в экспериментах, доступен через API Anthropic - с VPN и международной картой.

Большая картина

Meta, Google, OpenAI и Anthropic соревнуются в гонке за более мощные базовые модели. NVIDIA тихо показывает, что правила игры можно менять через системный уровень. Это стратегически важный сигнал от компании, которая контролирует железо: следующий фронтир - не следующий GPT, а следующая агентная архитектура.

Я думаю, что в ближайшие два года мы увидим волну агентных фреймворков, вдохновленных этой работой. И, возможно, именно это окажется тем самым шагом, который превратит "умные чат-боты" в по-настоящему автономные системы, способные работать неделями без человека.

Источники

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости