Ataraxos: ИИ за $8000 разгромил лучшего игрока в Stratego

Stratego долго держался. Пока шахматы пали перед Deep Blue еще в 1997-м, а Go - перед AlphaGo в 2016-м, эта настольная военная игра оставалась одним из последних бастионов, где человек стабильно бил машину. Теперь и этот рубеж сдан - причем сдан командой с университетским бюджетом, которая уложилась меньше чем в $8000 на обучение.
Счет, который говорит сам за себя
В официальной серии из 20 партий система Ataraxos сыграла против Пима Ниймейера - голландца, которого Джордж Франка, участник каждого чемпионата мира с 1997 года, называет "лучшим игроком в Stratego всех времен". Ниймейер выиграл четыре чемпионата мира, 15 национальных титулов Нидерландов и два онлайн-чемпионата мира, суммарно провел в мировом топе больше 600 недель. Результат серии: 15 побед Ataraxos, 1 поражение, 4 ничьи. На демонстрации из 40 партий на чемпионате мира машина выдала результат 39-2.
Исследование опубликовано в Nature. Авторы - Сэмюэл Сокота из Carnegie Mellon (ведущий автор), Юджин Виницки из NYU, Хенгюань Ху из Stanford, Чжиюань Фань из MIT и профессор Габриэле Фарина из MIT в роли старшего автора.
Почему Stratego так долго не давался машинам
В шахматах лучший ход остается лучшим независимо от того, как часто ты его делаешь. В Stratego все иначе. Оба игрока расставляют по 40 фигур лицом вниз - противник не знает, где маршал, где минеры, где бомбы. Ранг фигуры раскрывается только в момент столкновения. Тот, кто захватит флаг соперника, побеждает.
Число возможных расстановок превышает 10^33 для стартовых конфигураций - это на порядки больше, чем в шахматах или го. Техники, которые хорошо работают в покере, здесь не масштабируются: в техасском холдеме всего 1326 возможных стартовых раздач, а вычислительная сложность методов на основе покерного ИИ растет вместе с объемом скрытой информации.
"В Stratego происходит взрыв возможных вселенных, с которыми нужно работать. ИИ-техники, разработанные для покера, здесь точно не масштабируются", - говорит Фарина.
Как DeepMind потратил миллионы - и уступил топ-игрокам
DeepMind предпринял серьезную попытку с системой DeepNash. Та обучалась на 1024 TPU-узлах в течение двух-трех месяцев. Авторы Ataraxos оценивают эти вычисления в $3-4,5 млн по ценам 2025 года. На чемпионате мира 2023 года DeepNash выиграл 19 из 28 партий, но уступил большинству топ-игроков - в том числе Ниймейеру.
Ataraxos обучался одну неделю на 16 GPU Nvidia H100, плюс еще четыре дня на четырех GPU для отдельной сети убеждений. Итог: примерно 1/500 от вычислительных затрат DeepNash, 1/30 от числа партий самоигры (~160 млн против ~5,5 млрд у DeepMind) и 1/100 от обучающих примеров.
Когда исследователи предложили DeepMind провести прямое сравнение двух систем, те отказались - сообщив, что код DeepNash больше не работает.
Что внутри Ataraxos
Система обучалась без человеческих данных, только через самоигру. - механизм регуляризации, который вынуждает ИИ разнообразить расстановки и ходы, не давая ему зафиксироваться на единственной стратегии. Сильная игра в Stratego требует высокой степени непредсказуемости: предсказуемых игроков эксплуатируют. По ходу обучения это давление постепенно ослабляется.
Во время партии система использует трансформерные сети политики и оценки в паре с сетью убеждений, которая моделирует скрытые фигуры противника. Перед каждым ходом она оценивает вероятные типы вражеских фигур и просчитывает варианты дальше. Плюс поиск во время игры: "одиночные шаги обновления методом затухающего обучения с подкреплением в точках принятия решений".
Отдельный вклад - написанный командой CUDA-симулятор, который обрабатывает около 10 млн обновлений состояния доски в секунду. Именно высокая скорость симуляции и дала возможность уложиться в университетский бюджет.
За пределами Stratego
Тот же набор техник авторы применили к другим играм с неполной информацией. Ataraxos показал первый сверхчеловеческий результат в Barrage Stratego, выставил рекорды на Hanabi во всех вариантах от двух до пяти игроков и обошел лучших ботов в доу дичжу (китайская карточная игра). Это говорит о том, что подход не заточен под одну игру.
Что это значит за пределами доски
В MIT открыто говорят о практических приложениях: военные маневры, деловые переговоры, кибербезопасность. Везде, где одна сторона не знает намерений другой и не может перебрать все варианты. Фарина формулирует точно: "В задачах с неполной информацией у вас нет роскоши перебирать все возможности - их слишком много".
Сейчас команда работает над тем, чтобы система могла объяснять свои решения на понятном человеку языке - потому что финальный выбор в реальных сценариях все равно должен оставаться за людьми.
Меня в этой истории больше всего впечатляет даже не победа над чемпионом, а соотношение затрат. Когда академическая команда на GPU-кластере за $8000 воспроизводит и превосходит результат, под который крупнейшая AI-лаборатория мира выделяла миллионы долларов и сотни TPU, это сигнал о том, что алгоритмическая эффективность сейчас важнее сырых вычислений. DeepMind делал ставку на масштаб. Carnegie Mellon - на правильную математику.
Информация подтверждена несколькими независимыми публикациями, включая оригинальную статью в журнале Nature.
Похожие новости
Apple ужесточает доступ к диску Mac из-за угроз со стороны ИИ-агентов
Apple объявила о новых ограничениях для функции "полного доступа к диску" в macOS - компания прямо указала, что ИИ-агенты существенно увеличат риски для конфиденциальности пользователей по мере своего развития.
OpenAI Dots: рабочий ИИ-агент, который заодно закажет ужин
OpenAI представила Dots - всегда активных агентов на базе GPT-6 Astra. Они работают как корпоративный софт, но при этом могут заказать бурито.
Ai2 открыла AstaBrief 8B: научные отчеты за 51 секунду
Allen Institute for AI выложил в открытый доступ модель AstaBrief 8B - она генерирует научные отчеты с цитатами в 3,5 раза быстрее Claude и стоит дешевле в обслуживании.