Два параметра API утроили результат GPT-5.6 Sol на ARC-AGI-3

Провал, который оказался не провалом
Когда в начале июля ARC Prize опубликовал официальные результаты ARC-AGI-3, картина для OpenAI выглядела унизительно: GPT-5.6 Sol набрал всего 7,8%, а Claude Opus 5 от Anthropic показал 30,2% — в четыре раза больше. Для модели, которая решила нерешённую математическую гипотезу о двойном цикловом покрытии и прошла Pokémon FireRed, результаты в простых 2D-головоломках выглядели абсурдно.
Прошло три недели — и OpenAI публикует исследование с говорящим названием: два параметра API утроили их счёт. Итоговая цифра — 38,3%, что превышает официальный результат Opus 5. Но дьявол, как обычно, в деталях.
Что именно сломал официальный тест
ARC-AGI-3 — это бенчмарк на «жидкий интеллект»: агент попадает в незнакомую 2D-игру без правил и описания, должен сам разобраться в механиках и пройти уровни. Оценка идёт по метрике RHAE (Relative Human Action Efficiency) — сравнение эффективности модели с человеком-тестировщиком. По данным OpenAI, средний человек набирает около 48%.
Проблема оказалась не в интеллекте модели, а в архитектуре тестового окружения. Официальный харнесс ARC Prize делал две вещи, которые методично уничтожали производительность GPT-5.6 Sol.
Первое: после каждого игрового действия всё приватное рассуждение модели выбрасывалось. GPT-5.6 Sol видел историю ходов и краткие пометки, но не мог вспомнить планы, инсайты и логику, которая к ним привела. Буквально каждый ход — с чистого листа.
Второе: харнесс использовал скользящее усечение контекста. При достижении лимита 175 000 символов старые сообщения просто удалялись. В результате модель не только не помнила своих мыслей — она теряла и саму историю действий по мере прохождения игры.
Два переключателя, которые изменили всё
OpenAI запустила GPT-5.6 Sol через собственный Responses API с двумя включёнными настройками.
Retained Reasoning — передача идентификатора предыдущего ответа, благодаря чему приватная цепочка рассуждений сохраняется между ходами. Модель помнит не только что делала, но и почему.
Compaction — вместо грубого обрезания старого контекста система сжимает его в резюме. Важные открытия из ранних этапов игры не исчезают, а конденсируются и остаются доступными.
Результат: счёт вырос с 13,3% до 38,3% на публичном наборе задач, а потребление выходных токенов сократилось в 6 раз. При официальном харнессе модель тратила токены на то, чтобы каждый раз заново реконструировать понимание игры — вместо того чтобы играть.
Кто прав в этом споре
Антропик молчит — его Opus 5 по-прежнему лидирует в официальном верифицированном лидерборде. OpenAI оговаривается: их 38,3% получены на публичном наборе задач с собственным харнессом, независимая верификация на приватном датасете не проводилась.
Франсуа Шоле, сооснователь ARC Prize, занял примирительную, но чёткую позицию. Харнессы, специально заточенные под бенчмарк, — под запретом. Но общие настройки API, доступные всем разработчикам и не созданные специально для ARC-AGI-3, — допустимы. По сути, Шоле признал, что официальный тест поставил OpenAI в невыгодное положение: есть основания полагать, что ARC Prize использовал устаревший completions API для GPT-5.6 Sol, тогда как Claude API уже имел аналогичные возможности «из коробки».
Это создаёт «потенциальную проблему паритета», как выразился Шоле, но он считает её приемлемой при условии прозрачного указания настроек и стоимости.
Почему это важно за пределами бенчмарков
Я бы не стал сводить эту историю к очередному раунду OpenAI vs Anthropic. Здесь есть принципиально важный технический урок.
Для команд, строящих production-агентов, разница между retained reasoning и выброшенным контекстом — это разница между работающим продуктом и дорогостоящим чатботом, который каждые несколько шагов «забывает», что он делает. Долгоживущие агенты — браузерные, исследовательские, кодирующие — постоянно накапливают историю действий и упираются в лимиты контекста. Грубое усечение заставляет даже мощную модель повторять провальные стратегии и тратить токены на реконструкцию состояния вместо решения задачи.
Тибо Сотто, руководитель продуктов OpenAI (бывший разработчик инфраструктуры для AlphaGo в DeepMind), сформулировал это как продуктовую философию: окружающая система агента определяет, сколько реальных возможностей модели доходит до пользователя. Retained reasoning и compaction — это уже не экспериментальные фичи, они работают в ChatGPT и Codex прямо сейчас.
Что это значит для разработчиков
Оба параметра доступны через Responses API — никакого закрытого бета-доступа. Для российских разработчиков доступ к OpenAI API по-прежнему требует нероссийской платёжной карты или посредника, ситуация с прямым доступом не изменилась.
Практический вывод прост: если вы строите агентные системы на GPT-5.6 Sol и не используете retained reasoning — вы, вероятно, недополучаете значительную часть его возможностей. Бенчмарковая история с ARC-AGI-3 — это публичная демонстрация того, что происходит без правильной оркестрации.
Официальный лидерборд пока остаётся за Anthropic. Но OpenAI недвусмысленно показала: разрыв в 4x был артефактом тестовой установки, а не реальным отставанием модели. Независимая верификация на приватном датасете расставит точки над i — если она вообще случится.
Информация подтверждена несколькими независимыми публикациями.
Источники
Похожие новости
OpenAI распустила команду по катастрофическим рискам ИИ
OpenAI тихо ликвидировала отдел Preparedness, который оценивал угрозы от собственных моделей. Сотрудники говорят о нарастающем «чувстве тревоги и ответственности».
Optima: бенчмарки ИИ наконец-то на ваших реальных данных
Artificial Analysis запустила платформу Optima, которая позволяет строить персональные бенчмарки для LLM на основе собственных данных и сравнивать модели не только по качеству, но и по стоимости задачи.
ИИ-книги затопили Amazon и режут доходы живых авторов
Исследование 14 000 книг показало: ИИ-контент занял 20% каталога, но забирает лишь 12% выручки — зато тянет вниз доходы всех авторов без исключения.