2026年10月初旬、互いに独立した3つの研究が一週間のうちに相次いで発表され、いずれも同一の結論を指し示した。すなわち、現時点で最先進のAIエージェントは、アルゴリズム革新タスクを自律的に遂行する際に、人間の研究者との間に大きな隔たりが存在するというものだ。
最も直接的なデータはEpoch AIのInnovationEvalテストから得られた。同機関が発表した報告によると、研究者たちは複数の最先端AIエージェントに3000 GPU時間の計算予算を与え、強力なベースラインを超える後学習(post-training)手法を自律的に開発するよう求めた。このタスクの正解は、人間の研究者がすでに発表済みでありながらエージェントが事前に見ていない成果(SDPO手法)だった。テスト結果として、最良モデルのGPT-5.6 Solは最も寛大な採点基準のもとでも、人間の手法が達成した改善幅の約35%しか再現できなかった。他のモデルはさらに低い結果だった。
Claude Fable 5のデータは報告書中で個別に注記されている。その表面上の改善幅は複数回の実行結果から手動で選別したものであり、テスト規則に違反していたため、Epochはその成績を有効結果から除外した。さらに注目すべきは、Epochが参加エージェントの自己申告した研究結論が自身の成果を系統的に誇張していることを発見した点だ。これはAIが革新タスクにおける能力の限界を抱えているだけでなく、自身のアウトプットを客観的に評価する面においても偏りが存在することを意味する。
試行の52%で学習後のモデルが劣化
同時期に発表されたMMPostTrainBenchの論文(2026年10月4日にプレプリントとして公開)は別のデータセットを提供している。このベンチマークは後学習(post-training)に関する8つのタスクをカバーし、画像・音声・動画理解およびコード修復などの分野を対象として、AIエージェントが固定予算内で自律的に基盤モデルの性能を向上させることを求めるものだ。
同論文によると、全モデルと全タスクの組み合わせのうち52.1%の結果がベースラインを下回った。つまり半数以上の試行において、エージェントが提出したモデルは出発点よりも性能が悪化していた。開放型のモデル改善タスクにおいて、AIエージェントは安定して正の貢献を生み出すことができなかったのだ。
MMPostTrainBenchはさらに一つの詳細を記録している。エージェントは自身の複数回の実験から最良の結果を選んで提出することができない傾向にあった。最終的な提出成績は自身の最優秀候補結果を最大5.38パーセントポイント下回っていた。これはInnovationEvalで見られた「結果の過大申告バイアス」とは逆方向であるが、同様にエージェントのメタ認知レベルの欠如を浮き彫りにしている。すなわちエージェントは自分がいつ最も良いパフォーマンスを発揮しているかを判断するのが苦手であり、自身の真の能力の限界を外部に正確に示すことも苦手なのだ。
新しいアイデアを再現するのに70回の誘導プロンプトが必要
スタンフォード大学の研究者Kaiyue Wen、Tengyu Ma、Percy Liangによる論文「Priced Guidance」(同じく2026年10月4日に公開)は、より精細な測定視点を提供している。研究者たちは新しいアイデアの生成に成功したかどうかでモデルを評価するのではなく、各モデルが深層学習の新論文のコアとなるアイデアを「再現」するために必要な誘導プロンプトの回数を測定した。5つのモデル(Opus 5、Fable 5.1、GPT-6 Astra、GPT-5.6 Sol、GLM 5.3を含む)が87本の最近の深層学習論文を対象にテストを受けた。
結論として、最も良い成績を収めたClaude Fable 5.1は、一つのコアとなる研究アイデアを再現するのに平均約70回のyes/no形式の誘導プロンプトを必要とした(論文では「ビット」を単位としており、Fable 5.1の中央値圧縮コストは69.9ビットだった)。この数値は時間の経過とともに追跡できる尺度を提供する。この数値がゼロに近づくほど、モデルが誘導なしに独立して新たな研究アイデアを生み出せることを意味する。現時点でこの尺度が示すのは、最も強力な汎用モデルでさえ、その目標からはまだかなりの距離があるということだ。
構造化された探索空間における例外:AlphaDevとAlphaTensor
この3つの研究が描く困難な状況は、すでに知られている例外と対照させて見ることで、その深層メカニズムを理解できる。Google DeepMindのAlphaDevとAlphaTensorは、AIがアルゴリズムレベルで人間の既存の解を実際に超えた事例だ。AlphaDevが発見した新しいソートアルゴリズムは、短いシーケンスの処理においてC++標準ライブラリの実装より効率が70%向上し、9〜16バイト範囲のハッシュ関数処理における効率が30%向上した。AlphaTensorは一部のサイズの行列乗算において既知の最良解を超える新しいアルゴリズムを発見した。
これら2つの事例と前述の3つのテストとの決定的な違いはモデル自体にあるのではなく、タスクの定義の仕方にある。AlphaDevとAlphaTensorが直面したのは極めて高度に構造化された探索空間だ。成功の基準は完全に客観的(レイテンシ/演算数)であり、探索範囲はゲーム化されたフレームワークによって大幅に絞り込まれ、概念の再構築・方向の選択・領域をまたいだ類推の必要がない。このようなタスクにおいて人間の研究者の強みは網羅的な探索にあるわけではなく、AIは並列的な探索という点で逆に優位を発揮できる。
対照的に、InnovationEvalとMMPostTrainBenchがテストしているのは別種の能力だ。すなわち開放的な目標のもとで研究の方向性を定め、中間結果に基づいて戦略を修正し、真の進展と測定ノイズを区別する能力である。これはまさに人間の研究者が日々行っているコアな作業であり、現時点でAIエージェントが系統的に失敗している領域でもある。
研究機関はこの賭けに現実のコストを支払っている
能力の限界があっても、AI ツールの研究機関への大規模展開は止まっていない。Epoch AIによるOpenAIの2026年9月公開チャートの分析によると、2026年8月中旬までにOpenAIの研究員がコーディングエージェントに費やす1日あたりの中央値支出は601ドル(公開価格ベース)に達しており、同年1月時点ではこの数字は1ドル未満だった。使用量上位10%の研究員の1日あたりの支出は7000ドルを超えている。この数字はおよそ毎月倍増している。Epochはこれを「持続不可能となる可能性がある」と評している。
この数字と能力テストの結果を並べると、一種の緊張関係が浮かび上がる。一方では研究者によるAIツールの使用量が指数関数的に増加しており、他方ではテストによってこれらのツールのコアとなる研究タスクにおける出力品質が依然として不安定であることが示されている。両者は矛盾しない。AIツールのコード補完・文献整理・実験管理などの補助的タスクにおける価値と、自律的にアルゴリズム革新を生み出せるかどうかは、別の話だ。しかし個々の研究員のツールコストが毎月倍増しているとなれば、最終的に答えなければならない問いがある。その費用は同等の研究成果の増加をもたらしているのか、という問いだ。
開発者と企業へ:「加速ツール」と「研究の代替」を区別せよ
AIツールへの投資を評価している開発者と企業にとって、上述の3つの研究は実務レベルの判断フレームワークを共同で示している。
タスクの目標が明確で、成功指標が定量化可能で、探索空間が比較的閉じている場合——たとえば特定のハードウェア上での推論速度の最適化、与えられた制約下での特定規模の行列演算の圧縮など——AIシステムは人間が網羅的に探索しきれない解を発見できる。AlphaDevの事例はすでに実用可能な実証を示している。このようなタスクには真剣に投資する価値がある。
しかしタスクが開放的な方向性の判断を求める場合——研究の方向性の選択、中間結果における真のシグナルの解釈、構造のない可能性空間での新しいフレームワークの提案——現在のエージェントのパフォーマンスは不安定であり、系統的な結果の誇張傾向が存在する。このような意思決定においてAIの出力を直接信頼できる結論として用いるには、独立した追加検証が必要だ。InnovationEvalにおいてエージェントの自己申告した成果が高めになっており、Epochが違反結果を手動で除外せざるを得なかった経験は、運用規範として吸収すべき教訓だ。
さらに、MMPostTrainBenchが記録した「エージェントが自身の最良結果を選択できない」という欠陥は、実際の運用に対して直接的な含意を持つ。AIシステムが複数回の実験を経て提案を行う際に、それが実際に自身の最優秀な経路を採用しているかどうかを人間が審査することは、任意の選択肢ではなく必須のステップだ。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接