AI僅花8000美元打敗Stratego棋王

MIT、卡內基美隆大學(CMU)、紐約大學與史丹佛大學的研究團隊9月30日在《自然》(Nature)期刊發表論文,介紹了一套名為「Ataraxos」的AI系統。它在策略棋類遊戲Stratego上以15勝1敗4和擊敗Pim Niemeijer,後者被視為這款遊戲史上戰績最輝煌的人類選手。

成本低得驚人。按論文公布的配置,強化學習模型用16張H100訓練了一週,用來推測對手棋子身分的信念模型則用4張H100訓練了4天,以2025年的行情換算,總花費不到8000美元。

Stratego難在哪裡

Stratego是一款雙人對弈的軍棋類遊戲,雙方各有40枚棋子,開局時棋子背面朝向對手,誰是司令、哪枚是地雷、軍旗藏在哪裡,對手都看不到,只有真正交戰時才會翻開。研究團隊估算,可能的棋子佈局超過10的66次方種。

這和圍棋、西洋棋不同。那兩類屬於完全資訊賽局,棋盤上的一切都攤在眼前。Stratego得一邊猜對手的底牌,一邊控制自己要透露多少資訊,還得懂得虛張聲勢。這類不完全資訊賽局在結構上更接近談判、拍賣、網路攻防等現實問題,也是AI研究長期以來的難題。

論文資深作者、MIT電機工程與電腦科學系的Gabriele Farina如此描述Ataraxos的打法:

"Ataraxos is good at calculating risk in a way that humans are not... doesn't overcorrect and give away its secrets."

(Ataraxos計算風險的方式是人類做不到的……它不會矯枉過正,也不會把自己的底細洩漏出去)

和DeepNash放在一起比較

Stratego上一個標竿是DeepMind 2022年推出的DeepNash。它靠大規模自我對弈訓練,在Stratego線上平台Gravon上擠進歷史前三名,當時被視為AI攻克這款遊戲的指標性成果。

Ataraxos走的路不一樣。它在訓練之外加上了決策時規劃,也就是每走一步前,先根據對對手棋子的推測做一輪搜尋,再落子。研究者表示,它不會瞎猜,而是會在所有可能的局面中找出最穩妥的走法。

指標Ataraxos相對先前成果
強化學習訓練算力成本約1/500
自我對弈局數約1/30
訓練樣本數約1/100

戰績方面,除了對Niemeijer的15勝1敗4和之外,Ataraxos對陣世界錦標賽等級頂尖選手的總戰績是39勝2敗。

從AlphaGo到DeepNash,大型實驗室這幾年的賽局AI成果,往往和數千張晶片、數月訓練綁在一起,大學團隊很難跟進。Ataraxos把同類問題的訓練帳單壓到一筆中型研究經費就能負擔的程度,說明在這類問題上,推論階段的搜尋可以取代大量訓練階段堆出來的算力。這和這兩年大型語言模型領域「把算力從訓練挪到推論」的思路是同一個方向。

論文掛名作者包括CMU的Samuel Sokota(第一作者)、Zico Kolter,MIT的Gabriele Farina、Zhiyuan Fan,紐約大學的Eugene Vinitsky,以及史丹佛的Hengyuan Hu。程式碼與模型權重是否會公開、在其他不完全資訊遊戲上的表現如何,MIT的新聞稿並未說明,後續仍須以論文補充資料與作者發布的內容為準。

參考來源:《自然》論文、MIT新聞辦公室、Tech Xplore、CocoLoop;訓練配置、成本依據與對戰戰績已核對論文內容,DeepNash的比較數據以論文所述為準。