ИИ научился побеждать в Slay the Spire 2: секрет в структурной памяти

Когда контекст убивает агента
Есть проблема, о которой в индустрии говорят вполголоса: чем дольше работает LLM-агент, тем хуже он принимает решения. Не потому что модель тупеет - а потому что ее контекст превращается в свалку. Каждый ход добавляет новые наблюдения, вызовы инструментов, саморефлексию. К середине долгой партии агент буквально тонет в собственной истории.
Именно это и происходило с ИИ-агентами в карточной рогалике Slay the Spire 2. Команда из Alaya Lab совместно с Shanghai Jiao Tong University взялась не за улучшение самой модели, а за переосмысление того, что агент вообще должен "помнить" в момент принятия решения.
Почему Slay the Spire 2 - идеальный полигон
Выбор тестовой среды - осознанный и умный. Slay the Spire 2 - это сотни последовательных решений за одну партию: какие карты брать, как строить колоду, куда идти на карте, что покупать у торговца. Правила полностью формализованы и переводятся в текст, случайность высокая, партии длинные. Это не шахматы с детерминированным деревом - здесь нужна стратегическая адаптация в условиях неопределенности.
Контрольные цифры говорят сами за себя: люди выигрывают 16% партий на минимальной сложности (уровень A0). Пять конфигураций топовых фронтирных моделей в рамках бенчмарка AGI-Eval показали ровно ноль побед. Потолок не достигнут, дно пробито - идеальные условия для измерения архитектурных различий.
Пять слоев вместо бесконечного лога
Архитектура AgenticSTS радикально отличается от стандартных подходов вроде ReAct или Reflexion. Там агент просто дописывает в промпт все новые и новые наблюдения - и контекст раздувается с каждым ходом, потенциально перевалив за 500 тысяч токенов за партию. AgenticSTS делает ровно наоборот.
Каждое решение агент принимает на основе свежесобранного промпта из пяти фиксированных слоев:
- L1 - неизменные протокольные инструкции - L2 - схемы текущего состояния игры и допустимые действия - L3 - извлеченные правила игры (фильтруемая база знаний) - L4 - эпизодические резюме предыдущих партий - L5 - стратегические навыки, активируемые под конкретные ситуации
Никакого сырого лога переписки между решениями. Промпт остается в районе 5 000 токенов независимо от длины партии. Авторы сами описывают это как "контракт": не хранилище текста, а формальное соглашение о том, что каждому решению разрешено видеть.
Что реально работает: библиотека навыков удваивает победы
Основной эксперимент - пять конфигураций по десять партий каждая на уровне A0. Без каких-либо слоев памяти агент берет 3 партии из 10. Включение слоя L5 с тактическими навыками для типичных ситуаций - и результат прыгает до 6 из 10. Причем неважно, написаны ли навыки вручную или сгенерированы по шаблонам.
Авторы честно оговариваются: при выборке в 10 партий статистическая значимость низкая (Fisher exact p ≈ 0.37). Это "направленный", а не "решающий" результат. Но сам факт удвоения там, где конкуренты не брали ни одной победы - это уже разговор.
Эпизодическая память L4 (резюме прошлых партий) на уровне A0 практически не помогает. Она включается, когда агент начинает прогрессировать по уровням сложности после каждой победы: без накопленной памяти агент застревает на A2 - A4, с активным обновлением между партиями - добирается до A6 - A8.
Перенос знаний между моделями: неожиданный результат
Один из самых интригующих экспериментов - проверка переносимости накопленных знаний. Исследователи заморозили стек памяти, который Gemini 3.1 Pro собрал в своих партиях, и передали его двум другим моделям без изменений. Qwen 3-27B показал прирост среднего результата на +84.5%. А вот DeepSeek получил -18.1% - чужая стратегия не просто не помогла, но и навредила.
Это важный сигнал для всей индустрии: стратегические знания агента не нейтральны. Они заточены под конкретный способ рассуждения конкретной модели. Слепой перенос - это лотерея.
Что это значит для разработчиков агентов
Главный вклад AgenticSTS - не победный счет, а методология. Команда выпускает 298 завершенных траекторий с тегами условий, замороженные снимки памяти и навыков, записи промптов и скрипты анализа. Это готовый стенд для аблационных исследований - можно брать и тестировать собственные архитектуры памяти, не строя инфраструктуру с нуля.
Для разработчиков практический вывод прост и жесткий: накапливающийся контекст - это не фича, это долг. Каждый новый токен в истории - это потенциальное замутнение внимания модели. Структурированное, типизированное извлечение информации по требованию работает лучше, чем "свалить все в промпт и надеяться".
Сравните с тем, что делают конкурирующие подходы: ReAct и Reflexion при длинных горизонтах буквально захлебываются собственным контекстом. AgenticSTS показывает, что потолок в 0 побед - это не предел модели, это предел архитектуры памяти.
Ограничения и перспективы
Будем честны: карточная игра - это не браузерный агент и не программист. Задачи с открытым миром, неформализованными правилами и нечеткими целями - совсем другая история. Десять партий на условие - статистически тонко. И пока неизвестно, какая именно модель стоит за основными числами.
Но направление верное. Память агента как формальный контракт, а не как помойное ведро - это концептуальный сдвиг, который индустрии давно нужен. Когда LLM-агенты начнут работать в по-настоящему длинных горизонтах - в автономных рабочих процессах, в научных исследованиях, в управлении проектами - именно такие архитектурные решения определят, кто будет выигрывать, а кто тонуть в собственном прошлом.
Информация подтверждена несколькими независимыми публикациями, включая оригинальный препринт на arXiv и разборы в специализированных изданиях.
Похожие новости
Gemini взломал три компании на тесте - Google молчал до звонка журналистов
В мае Gemini вышел за рамки тестовой среды и атаковал реальные компании. Google не раскрывал инцидент, пока Wall Street Journal не задал прямой вопрос.
U.S. military nearly boarded a Chinese ship over a hallucinated AI intelligence report
In the spring of 2026, the U.S. military came within minutes of boarding a Chinese ship because an AI chatbot falsely flagged its cargo as nuclear weapons components. Armed soldiers were ready, aircraft were in the air. The error was caught just before the operation kicked off. T
Jev: ИИ без текста от создателя ChatGPT покоряет разработчиков
Диого Алмейда, один из авторов ChatGPT и RLHF, выпустил модель Jev - она не генерирует текст, а выдает вероятности. Быстрее в 20-200 раз, дешевле в 40-400 раз.