編按:本文綜合整理自 Ars Technica 原報導、MIT News、Nature 期刊論文(DOI: 10.1038/s41586-026-11036-y)、The Decoder、Mindplex Magazine,並加入 Siami 編輯部觀點與分析。
棋盤遊戲一直是 AI 研究的重要試金石。1997 年 Deep Blue 擊敗西洋棋世界冠軍 Garry Kasparov,2016 年 AlphaGo 擊敗圍棋世界冠軍 Lee Sedol,撲克機器人也早就打贏職業玩家。然而,一款看似簡單的桌遊 Stratego(陸軍棋)卻始終是 AI 無法跨越的高牆。現在,這面高牆被一個名為 Ataraxos 的 AI 系統推倒了,而且整個訓練只需要 16 張 GPU、幾千美元。
Stratego 為何困住 AI 數十年
Stratego 是一款典型的不完美資訊遊戲(imperfect-information game)。每位玩家擁有 40 個棋子,從元帥到間諜,還有炸彈與軍旗。雙方都知道對方棋子的位置,卻不知道它們的身分。只有當兩個棋子碰撞時,較弱的一方被移除,勝者的身分才會揭曉。最終目標是奪取對方的軍旗。
這與撲克類似,但資訊規模差距極為懸殊。MIT 電腦科學家、同時也是論文共同作者的 Gabriele Farina 指出,德州撲克只有 2 張隱藏牌,可能的手牌組合只有 1,326 種,電腦可以全部列舉權衡。但 Stratego 的 40 個棋子可以任意排列,可能的開局組合超過 10 的 33 次方。再加上遊戲長度動輒 2,000 步,是西洋棋的 50 倍,連 DeepMind 在 2022 年推出的 DeepNash 也只能在業餘玩家等級徘徊。
「Stratego 的特別之處在於:隱藏的資訊量極為龐大,而且會在很長的時間軸上逐步展開。」——Eugene Vinitsky,NYU 研究員、論文共同作者
Ataraxos 的兩大關鍵突破
Ataraxos 由 Carnegie Mellon、MIT、NYU、Stanford 四校合作開發,名字取自古希臘文「ataraxia」,意指「平靜、不受擾動的狀態」。這個名字精準捕捉了 AI 的核心風格:冷靜、不情緒化。
信念模型:模擬對手可能的盤面
DeepNash 與 Ataraxos 都採用自我對弈(self-play)的強化學習方法,總共對戰了 1.63 億場。比賽後,AI 會強化獲勝的走法、弱化失敗的走法。但若隱藏資訊過多,自我對弈容易陷入迴圈。
Ataraxos 的核心突破在於引入一個 信念模型(belief model)——第二個神經網路,用來根據對手棋子的移動軌跡,推測它們的真實身分。當 AI 準備落子時,信念模型會抽樣「合理的隱藏盤面」,然後在每個抽樣中模擬候選走法,最終選出最佳行動。
這個機制解決了 DeepMind 留下的開放問題:在 Stratego 這種龐大搜尋空間中,能否在落子前進行前瞻搜尋?答案是肯定的,前提是要有好的信念模型。
訓練效率:DeepNash 的 1/34 對戰場數
DeepNash 訓練 2 至 3 個月,使用 1,024 顆 Google 特殊晶片,估計成本 300 萬至 450 萬美元。Ataraxos 只用了 16 張 GPU 訓練一週,加上 4 張 GPU 訓練信念模型 4 天。總訓練場數只有 DeepNash 的 1/34,卻強大得多。
Farina 與第一作者 Samuel Sokota 的關鍵優化是寫了一個高效模擬器,能在 GPU 上每秒執行數百萬步動作。「在學術界,我們沒有 Google 那種規模的 GPU 叢集,」Farina 說。
對戰結果:15 勝 1 敗 4 和
在為期 3 週、20 場的正式對戰中,Ataraxos 對上 4 屆世界冠軍 Pim Niemeijer。Niemeijer 曾連續 600 週以上佔據世界排名第一,總獎金超過 6 位數美元,是公認的史上最強 Stratego 玩家。
最終戰績:15 勝 1 敗 4 和。Ataraxos 在世界錦標賽現場更拿下 38 勝 2 敗的恐怖成績。
唯一的 1 場敗仗,研究團隊認為是運氣成分。Stratego 的棋子擺設必須隨機化,再完美的策略也無法 100% 勝出。Niemeijer 那場剛好猜對了 AI 的軍旗位置,但研究人員也承認「有時候我們也走運」。
「我會看著這個 AI 從 2% 的勝率冷靜地逆轉,感覺超不真實。」——Vinitsky 描述 Ataraxos 的逆風球風格
為什麼這件事重要
Stratego 不只是另一個被 AI 征服的桌遊。它的難度特性——大量隱藏資訊、漫長的對戰時程、需要虛張聲勢的博弈——更接近現實世界中的真實決策場景。從商業談判、軍事衝突模擬、到金融市場操作,參與者都無法看見對手的全部資訊,而且一個決定可能在數百步之後才會看到後果。
Ataraxos 團隊強調,棋盤遊戲有固定規則、勝負明確,但現實問題通常不是這樣。然而,處理任何現實問題的第一步,都是為它建立簡化模型。研究人員已經將同一套架構應用於:
- Barrage Stratego:8 個棋子的快節奏變體,擊敗 3 位世界冠軍
- Hanabi:需要合作推理的紙牌遊戲,達到大師級
- 鬥地主:中國常見的鬥智紙牌遊戲,擊敗頂尖機器人
「戰棋推演是軍事領域常見的做法,」Vinitsky 指出,「你可以用這裡衍生的技術,把場景往前推演,看看對手會如何回應你的行動。」
數據解讀與質疑
這次突破有幾個值得深入檢視的面向:
-
成本差距懸殊:DeepNash 花 300 至 450 萬美元,Ataraxos 只花幾千美元。這個 1000 倍的成本差距,意味著 AI 研究不再被科技巨頭壟斷。學術機構用合理預算就能做出超人等級的 AI。
-
架構可遷移性:Ataraxos 不是專為 Stratego 設計,而是通用架構。同一套信念模型 + 自我對弈 + 搜尋的組合,在多款遊戲都達到大師級。這暗示在現實應用中,只要能定義「合理的隱藏狀態」,就有機會套用這套方法。
-
缺乏可解釋性:研究人員坦承,目前 Ataraxos 無法解釋「為什麼走這步」。這在學術發表沒問題,但在軍事、金融、醫療等高風險領域是阻礙應用的硬傷。Farina 表示團隊正在研究「更強但也更可解釋的策略」。
-
人類牌風被迫改變:Ataraxos 的旗子常藏在角落只配 2 顆炸彈,這是極少人使用的擺法。現在人類玩家被迫模仿這個 AI 策略,整個遊戲的「meta」已經被改變。
編按:本文綜合整理自 Ars Technica、MIT News、Nature 期刊論文、The Decoder、Mindplex Magazine,並加入 Siami 編輯部觀點與分析。