8000ドル未満のAIがStratego王者を撃破

MIT、カーネギーメロン大学(CMU)、ニューヨーク大学、スタンフォード大学の研究者らは9月30日、学術誌『Nature』に論文を発表した。論文は「Ataraxos」と名付けられたAIシステムを紹介するもので、戦略ボードゲーム「Stratego」において、同ゲーム史上最も輝かしい戦績を持つとされる人間のトッププレーヤー、Pim Niemeijer氏を15勝1敗4分で破ったという。

学習コストは際立って低い。論文が示す構成によれば、強化学習モデルはH100 16枚で1週間、対戦相手の駒の正体を推測する「信念モデル」はH100 4枚で4日間学習させた。2025年時点の価格で計算すると、総費用は8000ドル未満に収まるという。

Strategoの難しさ

Strategoは2人対戦制の軍人将棋のようなゲームで、双方が40個の駒を持つ。対局開始時、駒は裏向きに並べられ相手からは見えず、誰が司令官でどれが地雷か、軍旗がどこにあるかは、実際に戦闘になるまで相手には分からない。研究チームの試算では、起こりうる駒の配置は10の66乗通りを超えるという。

この点は囲碁や将棋とは異なる。囲碁や将棋は盤面の情報がすべて公開された完全情報ゲームだ。Strategoでは相手の手の内を読みつつ、自分がどこまで情報を漏らすかをコントロールし、時にはハッタリも使いこなす必要がある。こうした不完全情報ゲームは、交渉やオークション、サイバー攻防といった現実の問題と構造的に近く、AI研究にとって長年の難題とされてきた。

論文の責任著者で、MIT電気工学・計算機科学科のGabriele Farina氏は、Ataraxosの打ち筋をこう説明する。

"Ataraxos is good at calculating risk in a way that humans are not... doesn't overcorrect and give away its secrets."

(Ataraxosは人間にはできない方法でリスクを計算するのが得意だ……過剰に反応して自分の手の内を明かしてしまうこともない)

DeepNashとの比較

Strategoにおけるこれまでの指標はDeepMindが2022年に発表した「DeepNash」だった。大規模な自己対戦によって学習され、Stratego対戦プラットフォーム「Gravon」の歴代ランキングでトップ3入りを果たし、当時はAIがこのゲームを攻略した象徴的な成果とみなされていた。

Ataraxosのアプローチは異なる。学習に加えて「意思決定時プランニング」を組み込んでいる点が特徴だ。一手ごとに、相手の駒についての推測に基づいて探索を行ってから着手する。研究者によれば、当てずっぽうで指すのではなく、あり得るすべての局面の中から最も手堅い一手を探すという。

指標Ataraxosの従来手法比
強化学習の学習計算コスト約1/500
自己対戦局数約1/30
学習サンプル数約1/100

成績面では、Niemeijer氏との15勝1敗4分に加え、世界選手権級のトップ選手との対戦成績は通算39勝2敗だった。

AlphaGoからDeepNashまで、ここ数年の大手研究機関によるゲームAIの成果は、往々にして数千枚規模のチップと数カ月の学習とセットになっており、大学の研究チームが追随するのは難しかった。Ataraxosは同種の問題の学習コストを、中規模の研究費でまかなえる水準まで引き下げてみせた。これは、推論段階の探索が学習段階の計算資源の多くを代替しうることを示しており、ここ数年の大規模言語モデル分野における「計算資源を学習から推論へシフトする」という潮流と同じ方向性だといえる。

論文の著者には、CMUのSamuel Sokota氏(筆頭著者)とZico Kolter氏、MITのGabriele Farina氏とZhiyuan Fan氏、ニューヨーク大学のEugene Vinitsky氏、スタンフォード大学のHengyuan Hu氏らが名を連ねる。コードやモデルの重みを公開するかどうか、他の不完全情報ゲームでの性能については、MITのプレスリリースでは言及されておらず、論文の補足資料や著者らの今後の発表を待つ必要がある。

参考資料:『Nature』掲載論文、MITニュースオフィス、Tech Xplore、CocoLoop。学習構成、コストの算出根拠、対戦成績は論文に基づき確認、DeepNashとの比較データは論文記載の数値による。