NVIDIA
Генерация кодаNVIDIAAVOARC-AGI-3агентный ИИClaude Opus 5

NVIDIA AVO: агентная система достигла 100% на ARC-AGI-3

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
NVIDIA AVO: агентная система достигла 100% на ARC-AGI-3

Когда модель — это только половина уравнения

Есть расхожее заблуждение в мире ИИ: чем мощнее языковая модель, тем умнее агент. NVIDIA только что публично разнесла этот миф в пыль. Их исследовательский проект AVO (Agentic Variation Operators) взял Claude Opus 5 — модель, которая сама по себе набирает 30% на бенчмарке ARC-AGI-3 — и в рамках агентной системы довела её до 100% по метрике RHAE. Все 183 уровня, все 25 сред. Это не улучшение результата, это смена парадигмы.

Я слежу за развитием агентных систем уже несколько лет, и честно скажу: такой разрыв между «голой» моделью и системой с обвязкой я видел впервые. Тридцать процентов против ста — это не оптимизация, это другой класс задач.

Что такое AVO и почему это не очередной wrapper

AVO — это не просто «оборачиватель» вокруг LLM с красивым промптом. Архитектура построена на нескольких ключевых принципах, которые вместе дают качественный скачок.

Первое: персистентная память. Агент не начинает каждый шаг с чистого листа — он накапливает контекст, помнит что пробовал, что не сработало, какие гипотезы уже проверены. Звучит банально, но большинство существующих агентных систем эту проблему решают плохо.

Второе: супервизор, который следит за общей траекторией поиска. Если прогресс застрял, супервизор вмешивается и перенаправляет основного агента. Это имитирует то, как работают опытные инженеры: есть тот, кто делает, и есть тот, кто смотрит на картину в целом.

Третье: инструментальное использование без предопределённого сценария. Агент сам решает, что инспектировать, что менять, что тестировать — не по скрипту, а по ситуации.

GPU-оптимизация как первый полигон

Прежде чем AVO добралась до ARC-AGI-3, она прошла боевые испытания на задаче оптимизации GPU-ядер. Это одна из самых неблагодарных инженерных задач: пространство поиска огромное, интуиция не работает, каждый эксперимент требует реального железа.

АVO автономно исследовала более 500 направлений, зафиксировала 40 версий ядер и в итоге достигла производительности на 10,5% выше, чем FlashAttention-4 на системах NVIDIA DGX B200. Без ручного вмешательства. Это не демо на игрушечной задаче — FlashAttention-4 это серьёзный технологический ориентир, над которым работали лучшие инженеры.

Для меня это самый впечатляющий результат во всей истории — даже более показательный, чем сотня процентов на бенчмарке. Потому что оптимизация GPU-ядер даёт реальный экономический эффект прямо сейчас.

ARC-AGI-3: почему этот бенчмарк имеет значение

ARC-AGI-3 от команды Франсуа Шолле — это не очередной тест на знание фактов или решение математических задач. Он специально создан так, чтобы проверять способность к обобщению в условиях, которых модель не видела при обучении. 183 уровня, 25 различных сред — каждая требует адаптации, а не воспроизведения выученных паттернов.

Для сравнения: лучший предыдущий публичный результат принадлежал системе VISTA. AVO не просто превзошла его по счёту — она сделала это, совершив на 12% меньше действий в среде. То есть не методом перебора, а более эффективным поведением. Это принципиальное различие.

Сами по себе модели GPT-4o, Claude 3.5 или Gemini 1.5 Pro на ARC-AGI-3 показывают скромные результаты именно потому, что задача требует не знаний, а архитектуры рассуждений. AVO это подтвердила экспериментально.

Что это меняет для разработчиков

Главный вывод для инженеров, строящих агентные системы: инвестиции в архитектуру агента могут окупаться сильнее, чем апгрейд базовой модели. Если ваш агент работает плохо, возможно проблема не в том, что вы используете GPT-4o вместо o3 — а в том, как вы управляете памятью, обратной связью и восстановлением после ошибок.

Практически это означает: прежде чем платить за более дорогую модель, разберитесь с системой вокруг неё. Persistent memory, supervision loop, structured tool use — это не «nice to have», это фундамент.

Для компаний, которые строят автономных агентов для длинных задач — кодогенерация, научные исследования, инженерные расчёты — работа NVIDIA даёт конкретный архитектурный шаблон, а не абстрактные принципы.

Доступность и российский контекст

AVO пока остаётся исследовательским проектом NVIDIA, а не коммерческим продуктом. Публичного API нет, репозиторий на момент публикации закрытый. Для российских разработчиков прямой доступ к системе недоступен — как и к DGX B200, на которых проводились тесты.

Однако архитектурные принципы полностью открыты в публикации, и ничто не мешает воспроизвести их на открытых моделях. Тем более что Claude Opus 5, использованный в экспериментах, доступен через API Anthropic — с VPN и международной картой.

Большая картина

Meta, Google, OpenAI и Anthropic соревнуются в гонке за более мощные базовые модели. NVIDIA тихо показывает, что правила игры можно менять через системный уровень. Это стратегически важный сигнал от компании, которая контролирует железо: следующий фронтир — не следующий GPT, а следующая агентная архитектура.

Я думаю, что в ближайшие два года мы увидим волну агентных фреймворков, вдохновлённых этой работой. И, возможно, именно это окажется тем самым шагом, который превратит «умные чат-боты» в по-настоящему автономные системы, способные работать неделями без человека.

Источники

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости