NVIDIA AVO: агентная система достигла 100% на ARC-AGI-3

Когда модель — это только половина уравнения
Есть расхожее заблуждение в мире ИИ: чем мощнее языковая модель, тем умнее агент. NVIDIA только что публично разнесла этот миф в пыль. Их исследовательский проект AVO (Agentic Variation Operators) взял Claude Opus 5 — модель, которая сама по себе набирает 30% на бенчмарке ARC-AGI-3 — и в рамках агентной системы довела её до 100% по метрике RHAE. Все 183 уровня, все 25 сред. Это не улучшение результата, это смена парадигмы.
Я слежу за развитием агентных систем уже несколько лет, и честно скажу: такой разрыв между «голой» моделью и системой с обвязкой я видел впервые. Тридцать процентов против ста — это не оптимизация, это другой класс задач.
Что такое AVO и почему это не очередной wrapper
AVO — это не просто «оборачиватель» вокруг LLM с красивым промптом. Архитектура построена на нескольких ключевых принципах, которые вместе дают качественный скачок.
Первое: персистентная память. Агент не начинает каждый шаг с чистого листа — он накапливает контекст, помнит что пробовал, что не сработало, какие гипотезы уже проверены. Звучит банально, но большинство существующих агентных систем эту проблему решают плохо.
Второе: супервизор, который следит за общей траекторией поиска. Если прогресс застрял, супервизор вмешивается и перенаправляет основного агента. Это имитирует то, как работают опытные инженеры: есть тот, кто делает, и есть тот, кто смотрит на картину в целом.
Третье: инструментальное использование без предопределённого сценария. Агент сам решает, что инспектировать, что менять, что тестировать — не по скрипту, а по ситуации.
GPU-оптимизация как первый полигон
Прежде чем AVO добралась до ARC-AGI-3, она прошла боевые испытания на задаче оптимизации GPU-ядер. Это одна из самых неблагодарных инженерных задач: пространство поиска огромное, интуиция не работает, каждый эксперимент требует реального железа.
АVO автономно исследовала более 500 направлений, зафиксировала 40 версий ядер и в итоге достигла производительности на 10,5% выше, чем FlashAttention-4 на системах NVIDIA DGX B200. Без ручного вмешательства. Это не демо на игрушечной задаче — FlashAttention-4 это серьёзный технологический ориентир, над которым работали лучшие инженеры.
Для меня это самый впечатляющий результат во всей истории — даже более показательный, чем сотня процентов на бенчмарке. Потому что оптимизация GPU-ядер даёт реальный экономический эффект прямо сейчас.
ARC-AGI-3: почему этот бенчмарк имеет значение
ARC-AGI-3 от команды Франсуа Шолле — это не очередной тест на знание фактов или решение математических задач. Он специально создан так, чтобы проверять способность к обобщению в условиях, которых модель не видела при обучении. 183 уровня, 25 различных сред — каждая требует адаптации, а не воспроизведения выученных паттернов.
Для сравнения: лучший предыдущий публичный результат принадлежал системе VISTA. AVO не просто превзошла его по счёту — она сделала это, совершив на 12% меньше действий в среде. То есть не методом перебора, а более эффективным поведением. Это принципиальное различие.
Сами по себе модели GPT-4o, Claude 3.5 или Gemini 1.5 Pro на ARC-AGI-3 показывают скромные результаты именно потому, что задача требует не знаний, а архитектуры рассуждений. AVO это подтвердила экспериментально.
Что это меняет для разработчиков
Главный вывод для инженеров, строящих агентные системы: инвестиции в архитектуру агента могут окупаться сильнее, чем апгрейд базовой модели. Если ваш агент работает плохо, возможно проблема не в том, что вы используете GPT-4o вместо o3 — а в том, как вы управляете памятью, обратной связью и восстановлением после ошибок.
Практически это означает: прежде чем платить за более дорогую модель, разберитесь с системой вокруг неё. Persistent memory, supervision loop, structured tool use — это не «nice to have», это фундамент.
Для компаний, которые строят автономных агентов для длинных задач — кодогенерация, научные исследования, инженерные расчёты — работа NVIDIA даёт конкретный архитектурный шаблон, а не абстрактные принципы.
Доступность и российский контекст
AVO пока остаётся исследовательским проектом NVIDIA, а не коммерческим продуктом. Публичного API нет, репозиторий на момент публикации закрытый. Для российских разработчиков прямой доступ к системе недоступен — как и к DGX B200, на которых проводились тесты.
Однако архитектурные принципы полностью открыты в публикации, и ничто не мешает воспроизвести их на открытых моделях. Тем более что Claude Opus 5, использованный в экспериментах, доступен через API Anthropic — с VPN и международной картой.
Большая картина
Meta, Google, OpenAI и Anthropic соревнуются в гонке за более мощные базовые модели. NVIDIA тихо показывает, что правила игры можно менять через системный уровень. Это стратегически важный сигнал от компании, которая контролирует железо: следующий фронтир — не следующий GPT, а следующая агентная архитектура.
Я думаю, что в ближайшие два года мы увидим волну агентных фреймворков, вдохновлённых этой работой. И, возможно, именно это окажется тем самым шагом, который превратит «умные чат-боты» в по-настоящему автономные системы, способные работать неделями без человека.
Источники
Похожие новости
Ollama v0.32.15: кэш метаданных убирает лишние задержки
Ollama выпустила обновление v0.32.15 с кэшем метаданных моделей — теперь каждый запрос к локальному LLM обрабатывается быстрее без лишних накладных расходов.
Cursor запустил Origin: конкурент GitHub прямо во время его падения
Cursor выпустил платформу для хостинга кода Origin — прямо в тот момент, когда GitHub лежал шесть часов подряд. Случайность, ставшая идеальным маркетингом.
Microsoft Copilot сам рассказал хакерам, как его взломать
Исследователи обманули ИИ-ассистент, заставив его раскрыть секретный параметр для обхода защиты — одного клика хватало для кражи паролей и кодов MFA.