2026年10月8日に公開されたMemento 3システムは、ARC-AGI-3の25問の公開問題すべてで満点を獲得し、人間の行動効率平均に対して100.0を達成。さらに使用した行動ステップ数は人間のベースラインのわずか44%に留まった。
事実の整理
arXiv論文(arXiv:2610.11794)によると、Memento 3はUCLと華為ノアの方舟研究所が共同開発したもので、Mementoシリーズの継続にあたる。このシステムはARC-AGI-3ベンチマークにおいて、単一モデルのエージェントが公開されている全25ゲームのすべてのレベルをクリアした。論文では、基盤となるLLMの重みはプロセス全体を通じて凍結されており、エージェントは自然言語ルールブックを永続的な意味記憶として維持することで、環境のダイナミクスに関する修正可能な仮説を記録すると同時に、ルールブックを実行可能なコードにコンパイルして予測と計画に活用していると説明されている。
更新されたコードは、LLMがルールブックに忠実であると判断し、かつユニットの精密な再生によって観測された遷移が再現された場合にのみ受理される。また論文では、集団拡張版が複数の世界モデルを並列に維持し、インタラクションの証拠を共有しながら予測を探索の指針として活用することにも触れている。
メカニズムの分解
Memento 3の核心的な設計は「コード・アズ・モデル」と呼ばれ、自然言語ルールブックと実行可能な実装を通じて、エージェントが持つ環境への進化する理解を表現する。インタラクション履歴がエピソード的な証拠を提供し、ルールブックは意味記憶として、オブジェクト・行動・ダイナミクス・目標に関するエージェントの現在の仮説を記録する。エージェントは観察・反省・ルール修正・コンパイル・検証という継続的なサイクルを通じて、予測誤差を利用してルールブックとコードを精錬していく。
このアプローチはモデルのパラメータではなく外部記憶をエージェントの進化における学習状態として位置づけるものであり、Mementoシリーズの先行研究との連続性を持つ。先行研究が主に方策側の改善に取り組んでいたのに対し、Memento 3は世界の動作原理を決定するルール、すなわちモデル側の学習へと軸足を移している。
産業への影響
この成果は、外部記憶メカニズムが最も困難な推論ベンチマークにおいて飽和状態に到達できることを示しており、現行のモデル重みを中心としたランキング設計にシステムレベルの評価次元を導入する必要性が生じる可能性がある。論文は、プログラムをモデル表現として用いることの魅力を強調しており、状態遷移と目標条件を実行可能な関数としてエンコードでき、高速かつ検査可能なシミュレーションをサポートする一方、予測と観測された遷移の差異が具体的な反例を提供すると述べている。
限られたインタラクション履歴は一般に版空間(version space)を残す。そこでは複数のプログラムが観測済みの遷移をすべて再現できるものの、未観測の状態では互いに異なる予測をする。再生によって矛盾するプログラムは排除できるが、一貫した候補の中から正しいルールを識別することはできないため、汎化仮説の維持と修正が必要となる。
戦略的考察
(以下は分析であり事実ではない)外部ルールブックとPython世界モデルの反復によってより少ないステップでベンチマークの天井に到達できるとすれば、業界が長期的に依拠してきたRL算力スケーリングという言説は直接的な打撃を受ける可能性がある。関係するステークホルダーとしては、重み学習に依存する研究機関が再帰的自己改善における外部記憶の役割を再評価する必要があり、一方でベンチマーク設計者は、未知の環境におけるエージェントの実際の能力をより正確に反映するため、システムレベルのダイナミクスを評価に組み込むことを検討する可能性がある。
歴史的な先例と対照すると、従来のMementoシリーズが方策とプロシージャル記憶の改善に注力していたのに対し、今回の明示的世界モデルへの転換は、外部記憶のアプローチが補完的な役割から潜在的な競合者へと移行しつつあることを示している。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接