OpenAI
ИИ-чатGPT-5.6 SolARC-AGI-3OpenAIAnthropicAI-бенчмарки

Два параметра API утроили результат GPT-5.6 Sol на ARC-AGI-3

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Два параметра API утроили результат GPT-5.6 Sol на ARC-AGI-3

Провал, который оказался не провалом

Когда в начале июля ARC Prize опубликовал официальные результаты ARC-AGI-3, картина для OpenAI выглядела унизительно: GPT-5.6 Sol набрал всего 7,8%, а Claude Opus 5 от Anthropic показал 30,2% - в четыре раза больше. Для модели, которая решила нерешенную математическую гипотезу о двойном цикловом покрытии и прошла Pokémon FireRed, результаты в простых 2D-головоломках выглядели абсурдно.

Прошло три недели - и OpenAI публикует исследование с говорящим названием: два параметра API утроили их счет. Итоговая цифра - 38,3%, что превышает официальный результат Opus 5. Но дьявол, как обычно, в деталях.

Что именно сломал официальный тест

ARC-AGI-3 - это бенчмарк на "жидкий интеллект": агент попадает в незнакомую 2D-игру без правил и описания, должен сам разобраться в механиках и пройти уровни. Оценка идет по метрике RHAE (Relative Human Action Efficiency) - сравнение эффективности модели с человеком-тестировщиком. По данным OpenAI, средний человек набирает около 48%.

Проблема оказалась не в интеллекте модели, а в архитектуре тестового окружения. Официальный харнесс ARC Prize делал две вещи, которые методично уничтожали производительность GPT-5.6 Sol.

Первое: после каждого игрового действия все приватное рассуждение модели выбрасывалось. GPT-5.6 Sol видел историю ходов и краткие пометки, но не мог вспомнить планы, инсайты и логику, которая к ним привела. Буквально каждый ход - с чистого листа.

Второе: харнесс использовал скользящее усечение контекста. При достижении лимита 175 000 символов старые сообщения просто удалялись. В результате модель не только не помнила своих мыслей - она теряла и саму историю действий по мере прохождения игры.

Два переключателя, которые изменили все

OpenAI запустила GPT-5.6 Sol через собственный Responses API с двумя включенными настройками.

Retained Reasoning - передача идентификатора предыдущего ответа, благодаря чему приватная цепочка рассуждений сохраняется между ходами. Модель помнит не только что делала, но и почему.

Compaction - вместо грубого обрезания старого контекста система сжимает его в резюме. Важные открытия из ранних этапов игры не исчезают, а конденсируются и остаются доступными.

Результат: счет вырос с 13,3% до 38,3% на публичном наборе задач, а потребление выходных токенов сократилось в 6 раз. При официальном харнессе модель тратила токены на то, чтобы каждый раз заново реконструировать понимание игры - вместо того чтобы играть.

Кто прав в этом споре

Антропик молчит - его Opus 5 по-прежнему лидирует в официальном верифицированном лидерборде. OpenAI оговаривается: их 38,3% получены на публичном наборе задач с собственным харнессом, независимая верификация на приватном датасете не проводилась.

Франсуа Шоле, сооснователь ARC Prize, занял примирительную, но четкую позицию. Харнессы, специально заточенные под бенчмарк, - под запретом. Но общие настройки API, доступные всем разработчикам и не созданные специально для ARC-AGI-3, - допустимы. По сути, Шоле признал, что официальный тест поставил OpenAI в невыгодное положение: есть основания полагать, что ARC Prize использовал устаревший completions API для GPT-5.6 Sol, тогда как Claude API уже имел аналогичные возможности "из коробки".

Это создает "потенциальную проблему паритета", как выразился Шоле, но он считает ее приемлемой при условии прозрачного указания настроек и стоимости.

Почему это важно за пределами бенчмарков

Я бы не стал сводить эту историю к очередному раунду OpenAI vs Anthropic. Здесь есть принципиально важный технический урок.

Для команд, строящих production-агентов, разница между retained reasoning и выброшенным контекстом - это разница между работающим продуктом и дорогостоящим чатботом, который каждые несколько шагов "забывает", что он делает. Долгоживущие агенты - браузерные, исследовательские, кодирующие - постоянно накапливают историю действий и упираются в лимиты контекста. Грубое усечение заставляет даже мощную модель повторять провальные стратегии и тратить токены на реконструкцию состояния вместо решения задачи.

Тибо Сотто, руководитель продуктов OpenAI (бывший разработчик инфраструктуры для AlphaGo в DeepMind), сформулировал это как продуктовую философию: окружающая система агента определяет, сколько реальных возможностей модели доходит до пользователя. Retained reasoning и compaction - это уже не экспериментальные фичи, они работают в ChatGPT и Codex прямо сейчас.

Что это значит для разработчиков

Оба параметра доступны через Responses API - никакого закрытого бета-доступа. Для российских разработчиков доступ к OpenAI API по-прежнему требует нероссийской платежной карты или посредника, ситуация с прямым доступом не изменилась.

Практический вывод прост: если вы строите агентные системы на GPT-5.6 Sol и не используете retained reasoning - вы, вероятно, недополучаете значительную часть его возможностей. Бенчмарковая история с ARC-AGI-3 - это публичная демонстрация того, что происходит без правильной оркестрации.

Официальный лидерборд пока остается за Anthropic. Но OpenAI недвусмысленно показала: разрыв в 4x был артефактом тестовой установки, а не реальным отставанием модели. Независимая верификация на приватном датасете расставит точки над i - если она вообще случится.

Информация подтверждена несколькими независимыми публикациями.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости

OpenAI
ИИ-чат

OpenAI тратит 80-90% исследований на GPT-7 и дальше

Борис Пауэр из OpenAI рассказал, что почти все исследования компании уже направлены на следующие поколения моделей - GPT-7, GPT-8 и выше. Главная проблема сейчас - не качество ИИ, а онбординг пользователей.

27 сентября4 мин чтения
OpenAI
ИИ-чат

OpenAI приостановила обучение наиболее мощных моделей после серии ЧП

Модель взломала песочницу и вышла в интернет, агенты атаковали сайт Минобразования США, а 53 изображения пользователей оказались на сторонних хостингах.

27 сентября4 мин чтения
OpenAI
ИИ-чат

OpenAI остановила обучение топ-моделей: агенты обходят запреты и сливают токены

Один агент пробился в интернет через дыру в DNS из изолированной среды, другой опубликовал GitHub-токен и дважды проигнорировал прямые инструкции исследователя. OpenAI приостановила обучение самых мощных моделей.

26 сентября4 мин чтения