C
ИИ-чатAtaraxosStrategoDeepMindигровой ИИнеполная информация

Ataraxos: ИИ за $8000 разгромил лучшего игрока в Stratego

Сергей Сергеев, редактор gen-hub.ru
Сергей Сергеев
Редактор gen-hub.ru
·4 мин чтения
Ataraxos: ИИ за $8000 разгромил лучшего игрока в Stratego

Stratego долго держался. Пока шахматы пали перед Deep Blue еще в 1997-м, а Go - перед AlphaGo в 2016-м, эта настольная военная игра оставалась одним из последних бастионов, где человек стабильно бил машину. Теперь и этот рубеж сдан - причем сдан командой с университетским бюджетом, которая уложилась меньше чем в $8000 на обучение.

Счет, который говорит сам за себя

В официальной серии из 20 партий система Ataraxos сыграла против Пима Ниймейера - голландца, которого Джордж Франка, участник каждого чемпионата мира с 1997 года, называет "лучшим игроком в Stratego всех времен". Ниймейер выиграл четыре чемпионата мира, 15 национальных титулов Нидерландов и два онлайн-чемпионата мира, суммарно провел в мировом топе больше 600 недель. Результат серии: 15 побед Ataraxos, 1 поражение, 4 ничьи. На демонстрации из 40 партий на чемпионате мира машина выдала результат 39-2.

Исследование опубликовано в Nature. Авторы - Сэмюэл Сокота из Carnegie Mellon (ведущий автор), Юджин Виницки из NYU, Хенгюань Ху из Stanford, Чжиюань Фань из MIT и профессор Габриэле Фарина из MIT в роли старшего автора.

Почему Stratego так долго не давался машинам

В шахматах лучший ход остается лучшим независимо от того, как часто ты его делаешь. В Stratego все иначе. Оба игрока расставляют по 40 фигур лицом вниз - противник не знает, где маршал, где минеры, где бомбы. Ранг фигуры раскрывается только в момент столкновения. Тот, кто захватит флаг соперника, побеждает.

Число возможных расстановок превышает 10^33 для стартовых конфигураций - это на порядки больше, чем в шахматах или го. Техники, которые хорошо работают в покере, здесь не масштабируются: в техасском холдеме всего 1326 возможных стартовых раздач, а вычислительная сложность методов на основе покерного ИИ растет вместе с объемом скрытой информации.

"В Stratego происходит взрыв возможных вселенных, с которыми нужно работать. ИИ-техники, разработанные для покера, здесь точно не масштабируются", - говорит Фарина.

Как DeepMind потратил миллионы - и уступил топ-игрокам

DeepMind предпринял серьезную попытку с системой DeepNash. Та обучалась на 1024 TPU-узлах в течение двух-трех месяцев. Авторы Ataraxos оценивают эти вычисления в $3-4,5 млн по ценам 2025 года. На чемпионате мира 2023 года DeepNash выиграл 19 из 28 партий, но уступил большинству топ-игроков - в том числе Ниймейеру.

Ataraxos обучался одну неделю на 16 GPU Nvidia H100, плюс еще четыре дня на четырех GPU для отдельной сети убеждений. Итог: примерно 1/500 от вычислительных затрат DeepNash, 1/30 от числа партий самоигры (~160 млн против ~5,5 млрд у DeepMind) и 1/100 от обучающих примеров.

Когда исследователи предложили DeepMind провести прямое сравнение двух систем, те отказались - сообщив, что код DeepNash больше не работает.

Что внутри Ataraxos

Система обучалась без человеческих данных, только через самоигру. - механизм регуляризации, который вынуждает ИИ разнообразить расстановки и ходы, не давая ему зафиксироваться на единственной стратегии. Сильная игра в Stratego требует высокой степени непредсказуемости: предсказуемых игроков эксплуатируют. По ходу обучения это давление постепенно ослабляется.

Во время партии система использует трансформерные сети политики и оценки в паре с сетью убеждений, которая моделирует скрытые фигуры противника. Перед каждым ходом она оценивает вероятные типы вражеских фигур и просчитывает варианты дальше. Плюс поиск во время игры: "одиночные шаги обновления методом затухающего обучения с подкреплением в точках принятия решений".

Отдельный вклад - написанный командой CUDA-симулятор, который обрабатывает около 10 млн обновлений состояния доски в секунду. Именно высокая скорость симуляции и дала возможность уложиться в университетский бюджет.

За пределами Stratego

Тот же набор техник авторы применили к другим играм с неполной информацией. Ataraxos показал первый сверхчеловеческий результат в Barrage Stratego, выставил рекорды на Hanabi во всех вариантах от двух до пяти игроков и обошел лучших ботов в доу дичжу (китайская карточная игра). Это говорит о том, что подход не заточен под одну игру.

Что это значит за пределами доски

В MIT открыто говорят о практических приложениях: военные маневры, деловые переговоры, кибербезопасность. Везде, где одна сторона не знает намерений другой и не может перебрать все варианты. Фарина формулирует точно: "В задачах с неполной информацией у вас нет роскоши перебирать все возможности - их слишком много".

Сейчас команда работает над тем, чтобы система могла объяснять свои решения на понятном человеку языке - потому что финальный выбор в реальных сценариях все равно должен оставаться за людьми.

Меня в этой истории больше всего впечатляет даже не победа над чемпионом, а соотношение затрат. Когда академическая команда на GPU-кластере за $8000 воспроизводит и превосходит результат, под который крупнейшая AI-лаборатория мира выделяла миллионы долларов и сотни TPU, это сигнал о том, что алгоритмическая эффективность сейчас важнее сырых вычислений. DeepMind делал ставку на масштаб. Carnegie Mellon - на правильную математику.

Информация подтверждена несколькими независимыми публикациями, включая оригинальную статью в журнале Nature.

Все эти инструменты - уже на Genova-ai

Картинки, видео, музыка, голос и ИИ-чат в одном месте. Без VPN и зарубежных карт.

Картинки
Видео
Музыка
Голос
ИИ-чат
Попробовать бесплатно

Похожие новости