2026年9月30日、『ネイチャー』誌に掲載された論文が具体的な数字をもって、ボードゲームにおける最後の人類の領地の陥落を宣言した。AIシステムAtaraxosは20局の正式シリーズ戦において、15勝1敗4引き分けという成績で4度の世界王者Pim Niemeijerを下した。このオランダ人棋士はStratego世界ランキングのトップを600週以上にわたって維持しており、史上最多タイトルを持つStratego選手として広く認められている。カーネギーメロン大学、MIT、ニューヨーク大学、スタンフォード大学の研究者からなる共同チームは、8000ドル未満の学習コストで、DeepMindが300万〜450万ドルを費やしても実現できなかった偉業を達成し、Stratego世界選手権においても39勝2敗という成績を収めた。
StrategoがチェスよりAIにとって難しい理由
この突破口の重みを理解するには、まずStrategoがAIに対して持つ特有の挑戦を理解する必要がある。チェスや囲碁は完全情報ゲームであり、盤上のすべてが双方に完全に見える状態にあるため、理論上は十分な深さの探索によって最適解に近づくことができる。しかしStrategoはまったく異なる世界だ。各プレイヤーの40枚の駒はそれぞれ異なる階級を持ち、ゲーム開始時には相手の駒が存在することはわかっても、その正体はわからない。2枚の駒が正面から衝突した時にのみ、弱い方が盤上から取り除かれ、同時に自らの階級が明かされる仕組みだ。
この情報の隠蔽が指数関数的な複雑性を生み出す。論文データによれば、Strateogの開局配置パターンは1033通りを超えており、囲碁の状態空間をはるかに上回る。チェスの対局が通常40手前後で終わるのに対し、Strateogは容易に2000手を超えることがある。さらに難しいのはブラフ(bluffing)の戦略的価値だ。弱い駒を最強の駒に見せかけて相手を牽制できるが、頻繁にブラフを使えば相手に見破られ、まったく使わなければ行動が予測可能になってしまう。このゲームレベルの「心理戦」が、これまでのすべてのAIアプローチをスケールアップの段階でボトルネックに追い込んできた。
本論文の責任著者であり、MIT電気工学・コンピュータサイエンス学科の助教授Gabriele Farinaは問題の規模をこう説明する。
「Strategoでは、処理しなければならない可能性の宇宙が爆発的に拡大します。ポーカーなどのゲーム向けに開発されたAI技術は、このような設定では到底スケールできません。」
三位一体のアーキテクチャ:自己対局・信念ネットワーク・意思決定時探索
Ataraxosの技術的核心は3つのコンポーネントの連携にある。それぞれ単体では目新しくないが、不完全情報シナリオへの統合方法こそが本論文の核心的な貢献だ。
第1のコンポーネントは自己対局による強化学習であり、システムは約1億6300万局の自己対局を通じて棋力を蓄積し、勝利につながる手が強化され、敗北につながる手が刈り込まれる。自己対局がループに陥る(たとえば特定の開局配置に固執するなど)のを防ぐため、チームは正則化メカニズムを導入した。学習初期には戦略が大きく変化するよう強制し、学習が進むにつれて調整幅を絞ることで、戦略ライブラリの多様性を確保し、人間の棋士が「読まれない」状態を維持する直感を再現した。
第2のコンポーネントは信念ネットワークであり、これが最も重要なイノベーションだ。従来の探索アルゴリズムは不完全情報シナリオでは状態空間の爆発により機能しなくなる。Ataraxosのアプローチは、相手の行動履歴から相手の隠れた駒の位置分布を推定することに特化した独立した生成モデルを学習させることだ。すべての可能性を列挙するのではなく、「最も信憑性の高い盤面状態」をサンプリングし、それらの状態上で候補手を探索する。Farinaはこう説明する。
「私たちは盲目的に推測しているのではなく、意思決定時の計画立案を用いて最も信憑性の高い盤面状態を見つけています。この生成モデルによって、現在直面している具体的な盤面と対戦相手に真に集中することができます。」
第3のコンポーネントは意思決定時探索(decision-time planning)だ。信念ネットワークが状態分布を提供し、戦略価値ネットワークが各候補手にスコアを付け、探索が限られた計算予算の中で期待収益が最も高い行動を見つける。この3者の統合により、Ataraxosは各手において「あらゆる可能性を列挙する」のではなく「根拠のある推測」に基づいて行動でき、解くことが不可能だった問題を解くことができる問題へと転換した。学習プロセス自体は16基のNvidia H100 GPU上で約1週間実行され、信念ネットワークの追加学習に4日を加えても、総計算コストは8000ドルを下回った。
先行事例との比較:DeepNashの失敗が示すもの
DeepMindのDeepNashは、これまでStrategoの攻略に最も近づいたAIシステムであり、2022年に初めて公開された。その学習規模はAtaraxosをはるかに上回り、公開情報によればDeepNashは300万〜450万ドルを費やし、約55億局を学習した。リソース投資がAtaraxosの約500倍にもかかわらず、DeepNashは正式な競技において人類のトップ棋士を超えるレベルに達することができなかった。
さらに注目に値するのは、Ataraxosチームが両システムの直接比較テストを積極的に提案したところ、DeepMindからはそれが実現不可能だという回答が返ってきた事実だ。理由はDeepNashのコードがすでに動作しなくなっていたからだという。この事実は、大型AI研究所内部のエンジニアリング現実の一端を示している。数百万ドルが投じられたプロジェクトであっても、継続的なメンテナンスがなければ、エンジニアリングとしての再現性は外部の期待をはるかに下回り得る。
歴史的な系譜で見れば、Strateogは連続する「最後の牙城」の最新事例だ。Deep Blueが1997年にカスパロフを下し、AlphaGoが2016年にイ・セドルを破り、テキサスホールデムのAIが近年プロのポーカープレイヤーを完全に圧倒してきた。その都度、情報ゲームを「真に理解する」新たな能力が必要だと言われてきたが、振り返ってみれば毎回、エンジニアリングとアルゴリズムの相互作用の産物だった。Ataraxosが異なる点は規模にある。より多くのリソースで問題を力押しするのではなく、よりスマートなアーキテクチャによって同種の問題を100分の1のコストで解決したのだ。
現実世界のタスクへの実際の意義
論文の著者自身は技術の外延について、慎重ながらも具体的な表現を維持している。Farinaは次のように指摘する。
「現実に直面する不完全情報タスクでは、すべての可能性を列挙するような贅沢はほとんど許されません。可能性が多すぎるのです。」Ataraxosは他の3種の不完全情報ゲーム(Barrage Stratego、協力型カードゲームHanabi、中国のトランプゲーム闘地主)においても強力なパフォーマンスを発揮しており、手法の汎化能力に関する初期のマルチタスク的な根拠を提供している。
AIエンジニアリングの実践においてより直接的な影響は、効率性パラダイムの転換だ。「信念ネットワーク+意思決定時探索」の組み合わせが他の不完全情報領域でもこの効率上の優位性を再現できるならば、サイバーセキュリティ(相手の行動意図の推測)、交渉戦略(相手の選好が未知)、サプライチェーンゲーム(隠れた在庫情報)といったシナリオにも、DeepNash式の計算力の力押しに頼ることなく、参照できるアルゴリズムの道筋が生まれることになる。
カーネギーメロン大学の博士課程学生であり論文の第一著者であるSamuel Sokotaは、Strateogとチェスの根本的な違いをこう比較した。
「これはチェスとはまったく異なります。チェスでは何度繰り返しても、最善手は最善手のままです。」この言葉は不完全情報ゲームの核心的な特性を指摘している。最適な行動が相手の隠れた状態に依存し、その隠れた状態が相手の各行動とともに更新されるため、戦略は確率的かつ適応的でなければならないのだ。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接