NVIDIA AVO: агентная система достигла 100% на ARC-AGI-3

Когда модель - это только половина уравнения
Есть расхожее заблуждение в мире ИИ: чем мощнее языковая модель, тем умнее агент. NVIDIA только что публично разнесла этот миф в пыль. Их исследовательский проект AVO (Agentic Variation Operators) взял Claude Opus 5 - модель, которая сама по себе набирает 30% на бенчмарке ARC-AGI-3 - и в рамках агентной системы довела ее до 100% по метрике RHAE. Все 183 уровня, все 25 сред. Это не улучшение результата, это смена парадигмы.
Я слежу за развитием агентных систем уже несколько лет, и честно скажу: такой разрыв между "голой" моделью и системой с обвязкой я видел впервые. Тридцать процентов против ста - это не оптимизация, это другой класс задач.
Что такое AVO и почему это не очередной wrapper
AVO - это не просто "оборачиватель" вокруг LLM с красивым промптом. Архитектура построена на нескольких ключевых принципах, которые вместе дают качественный скачок.
Первое: персистентная память. Агент не начинает каждый шаг с чистого листа - он накапливает контекст, помнит что пробовал, что не сработало, какие гипотезы уже проверены. Звучит банально, но большинство существующих агентных систем эту проблему решают плохо.
Второе: супервизор, который следит за общей траекторией поиска. Если прогресс застрял, супервизор вмешивается и перенаправляет основного агента. Это имитирует то, как работают опытные инженеры: есть тот, кто делает, и есть тот, кто смотрит на картину в целом.
Третье: инструментальное использование без предопределенного сценария. Агент сам решает, что инспектировать, что менять, что тестировать - не по скрипту, а по ситуации.
GPU-оптимизация как первый полигон
Прежде чем AVO добралась до ARC-AGI-3, она прошла боевые испытания на задаче оптимизации GPU-ядер. Это одна из самых неблагодарных инженерных задач: пространство поиска огромное, интуиция не работает, каждый эксперимент требует реального железа.
AVO автономно исследовала более 500 направлений, зафиксировала 40 версий ядер и в итоге достигла производительности на 10,5% выше, чем FlashAttention-4 на системах NVIDIA DGX B200. Без ручного вмешательства. Это не демо на игрушечной задаче - FlashAttention-4 это серьезный технологический ориентир, над которым работали лучшие инженеры.
Для меня это самый впечатляющий результат во всей истории - даже более показательный, чем сотня процентов на бенчмарке. Потому что оптимизация GPU-ядер дает реальный экономический эффект прямо сейчас.
ARC-AGI-3: почему этот бенчмарк имеет значение
ARC-AGI-3 от команды Франсуа Шолле - это не очередной тест на знание фактов или решение математических задач. Он специально создан так, чтобы проверять способность к обобщению в условиях, которых модель не видела при обучении. 183 уровня, 25 различных сред - каждая требует адаптации, а не воспроизведения выученных паттернов.
Для сравнения: лучший предыдущий публичный результат принадлежал системе VISTA. AVO не просто превзошла его по счету - она сделала это, совершив на 12% меньше действий в среде. То есть не методом перебора, а более эффективным поведением. Это принципиальное различие.
Сами по себе модели GPT-4o, Claude 3.5 или Gemini 1.5 Pro на ARC-AGI-3 показывают скромные результаты именно потому, что задача требует не знаний, а архитектуры рассуждений. AVO это подтвердила экспериментально.
Что это меняет для разработчиков
Главный вывод для инженеров, строящих агентные системы: инвестиции в архитектуру агента могут окупаться сильнее, чем апгрейд базовой модели. Если ваш агент работает плохо, возможно проблема не в том, что вы используете GPT-4o вместо o3 - а в том, как вы управляете памятью, обратной связью и восстановлением после ошибок.
Практически это означает: прежде чем платить за более дорогую модель, разберитесь с системой вокруг нее. Persistent memory, supervision loop, structured tool use - это не "nice to have", это фундамент.
Для компаний, которые строят автономных агентов для длинных задач - кодогенерация, научные исследования, инженерные расчеты - работа NVIDIA дает конкретный архитектурный шаблон, а не абстрактные принципы.
Доступность и российский контекст
AVO пока остается исследовательским проектом NVIDIA, а не коммерческим продуктом. Публичного API нет, репозиторий на момент публикации закрытый. Для российских разработчиков прямой доступ к системе недоступен - как и к DGX B200, на которых проводились тесты.
Однако архитектурные принципы полностью открыты в публикации, и ничто не мешает воспроизвести их на открытых моделях. Тем более что Claude Opus 5, использованный в экспериментах, доступен через API Anthropic - с VPN и международной картой.
Большая картина
Meta, Google, OpenAI и Anthropic соревнуются в гонке за более мощные базовые модели. NVIDIA тихо показывает, что правила игры можно менять через системный уровень. Это стратегически важный сигнал от компании, которая контролирует железо: следующий фронтир - не следующий GPT, а следующая агентная архитектура.
Я думаю, что в ближайшие два года мы увидим волну агентных фреймворков, вдохновленных этой работой. И, возможно, именно это окажется тем самым шагом, который превратит "умные чат-боты" в по-настоящему автономные системы, способные работать неделями без человека.
Источники
Похожие новости
DeepSeek Harness v0.2: десктоп, плагины и планировщик задач без командной строки
DeepSeek выпустил v0.2 своего агентного фреймворка с нативными приложениями для macOS и Windows, встроенным менеджером плагинов и планировщиком задач на базе session-local механизма.
OpenAI и Synopsys учат ИИ проектировать чипы вместе с инженерами
OpenAI и Synopsys запустили многолетнее партнерство и строят GPT-Synopsys - специализированную модель, которая умеет работать с EDA-инструментами и помогает инженерам оптимизировать дизайн полупроводников.
H Company выпустила Holo4: агент для компьютера за $0.08 за задачу
H Company открыла веса Holo4 - двух моделей для управления компьютером, которые набирают 85.2% на OSWorld и обходят GPT-5.5 по соотношению цены и результата.