OpenAI
ИИ-чатGPT-5.6 SolARC-AGI-3OpenAIAnthropicAI-бенчмарки

Два параметра API утроили результат GPT-5.6 Sol на ARC-AGI-3

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Два параметра API утроили результат GPT-5.6 Sol на ARC-AGI-3

Провал, который оказался не провалом

Когда в начале июля ARC Prize опубликовал официальные результаты ARC-AGI-3, картина для OpenAI выглядела унизительно: GPT-5.6 Sol набрал всего 7,8%, а Claude Opus 5 от Anthropic показал 30,2% — в четыре раза больше. Для модели, которая решила нерешённую математическую гипотезу о двойном цикловом покрытии и прошла Pokémon FireRed, результаты в простых 2D-головоломках выглядели абсурдно.

Прошло три недели — и OpenAI публикует исследование с говорящим названием: два параметра API утроили их счёт. Итоговая цифра — 38,3%, что превышает официальный результат Opus 5. Но дьявол, как обычно, в деталях.

Что именно сломал официальный тест

ARC-AGI-3 — это бенчмарк на «жидкий интеллект»: агент попадает в незнакомую 2D-игру без правил и описания, должен сам разобраться в механиках и пройти уровни. Оценка идёт по метрике RHAE (Relative Human Action Efficiency) — сравнение эффективности модели с человеком-тестировщиком. По данным OpenAI, средний человек набирает около 48%.

Проблема оказалась не в интеллекте модели, а в архитектуре тестового окружения. Официальный харнесс ARC Prize делал две вещи, которые методично уничтожали производительность GPT-5.6 Sol.

Первое: после каждого игрового действия всё приватное рассуждение модели выбрасывалось. GPT-5.6 Sol видел историю ходов и краткие пометки, но не мог вспомнить планы, инсайты и логику, которая к ним привела. Буквально каждый ход — с чистого листа.

Второе: харнесс использовал скользящее усечение контекста. При достижении лимита 175 000 символов старые сообщения просто удалялись. В результате модель не только не помнила своих мыслей — она теряла и саму историю действий по мере прохождения игры.

Два переключателя, которые изменили всё

OpenAI запустила GPT-5.6 Sol через собственный Responses API с двумя включёнными настройками.

Retained Reasoning — передача идентификатора предыдущего ответа, благодаря чему приватная цепочка рассуждений сохраняется между ходами. Модель помнит не только что делала, но и почему.

Compaction — вместо грубого обрезания старого контекста система сжимает его в резюме. Важные открытия из ранних этапов игры не исчезают, а конденсируются и остаются доступными.

Результат: счёт вырос с 13,3% до 38,3% на публичном наборе задач, а потребление выходных токенов сократилось в 6 раз. При официальном харнессе модель тратила токены на то, чтобы каждый раз заново реконструировать понимание игры — вместо того чтобы играть.

Кто прав в этом споре

Антропик молчит — его Opus 5 по-прежнему лидирует в официальном верифицированном лидерборде. OpenAI оговаривается: их 38,3% получены на публичном наборе задач с собственным харнессом, независимая верификация на приватном датасете не проводилась.

Франсуа Шоле, сооснователь ARC Prize, занял примирительную, но чёткую позицию. Харнессы, специально заточенные под бенчмарк, — под запретом. Но общие настройки API, доступные всем разработчикам и не созданные специально для ARC-AGI-3, — допустимы. По сути, Шоле признал, что официальный тест поставил OpenAI в невыгодное положение: есть основания полагать, что ARC Prize использовал устаревший completions API для GPT-5.6 Sol, тогда как Claude API уже имел аналогичные возможности «из коробки».

Это создаёт «потенциальную проблему паритета», как выразился Шоле, но он считает её приемлемой при условии прозрачного указания настроек и стоимости.

Почему это важно за пределами бенчмарков

Я бы не стал сводить эту историю к очередному раунду OpenAI vs Anthropic. Здесь есть принципиально важный технический урок.

Для команд, строящих production-агентов, разница между retained reasoning и выброшенным контекстом — это разница между работающим продуктом и дорогостоящим чатботом, который каждые несколько шагов «забывает», что он делает. Долгоживущие агенты — браузерные, исследовательские, кодирующие — постоянно накапливают историю действий и упираются в лимиты контекста. Грубое усечение заставляет даже мощную модель повторять провальные стратегии и тратить токены на реконструкцию состояния вместо решения задачи.

Тибо Сотто, руководитель продуктов OpenAI (бывший разработчик инфраструктуры для AlphaGo в DeepMind), сформулировал это как продуктовую философию: окружающая система агента определяет, сколько реальных возможностей модели доходит до пользователя. Retained reasoning и compaction — это уже не экспериментальные фичи, они работают в ChatGPT и Codex прямо сейчас.

Что это значит для разработчиков

Оба параметра доступны через Responses API — никакого закрытого бета-доступа. Для российских разработчиков доступ к OpenAI API по-прежнему требует нероссийской платёжной карты или посредника, ситуация с прямым доступом не изменилась.

Практический вывод прост: если вы строите агентные системы на GPT-5.6 Sol и не используете retained reasoning — вы, вероятно, недополучаете значительную часть его возможностей. Бенчмарковая история с ARC-AGI-3 — это публичная демонстрация того, что происходит без правильной оркестрации.

Официальный лидерборд пока остаётся за Anthropic. Но OpenAI недвусмысленно показала: разрыв в 4x был артефактом тестовой установки, а не реальным отставанием модели. Независимая верификация на приватном датасете расставит точки над i — если она вообще случится.

Информация подтверждена несколькими независимыми публикациями.

Все эти инструменты — уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости