2026年9月3日にARC Prizeが発表したテスト報告によると、GPT-6 AstraはARC-AGI-3 Semi-Privateタスクセットにおいて、標準harnessでのスコアが62.7%(コスト2.6万ドル)、Provider Adapter harnessでのスコアが99.9%(コスト1.9万ドル)を記録した。
事実の整理
報告書は2種類のharnessを明確に区別している。標準harnessでは、モデルが自ら選択したノートを環境全体にわたって保持することが許可される。一方、Provider Adapter harnessは不透明な推論状態を維持しつつ圧縮を使用し、リクエストをまたいだ過去の作業の再利用をサポートする。いずれのフレームワークでも、モデルは現時点での最高スコアを達成しており、最大推論努力レベルにおけるアクション効率は人間の中央値を上回り、96%のレベルで人間より少ないアクション数を記録した。
メカニズムの分析
スコアの差異は、状態保持方式の違いに直接起因している。標準harnessでは、モデルは各リクエストで自身のノートのみに依存しなければならない。一方、Provider Adapter harnessではモデルの内部状態が継続的に保持され、長い会話が圧縮されるため、推論の重複コストが削減される。報告書の表によると、推論努力をnoneからmaxに引き上げるにつれて、標準harnessのコストは4.9万ドルから2.6万ドルへと低下し、Provider Adapter harnessのコストは2.3万ドルから約1.7万ドルへと低下した。
業界への影響
この事例は、評価基準の選択がランキングに与える決定的な影響を改めて浮き彫りにした。以前のExploitBenchにおける満点争議でも同様の疑問が提起されていたが、今回の件はベンチマークの横断的比較可能性における構造的問題をさらに拡大させた。人間参加者のテストコストは1試行あたり約12.78ドルであるのに対し、モデルは高効率な推論においてこの水準に近いかそれを下回るコストを実現しているが、2種類のharnessの公平性については依然として議論が残る。
戦略的見解
【分析】ベンチマーク策定者が状態保持ルールを統一できない場合、将来的に各ベンダーが自社に有利なharnessを選んでスコアを提出する傾向が強まり、公開リーダーボードの参考価値が低下するおそれがある。標準harnessを用いたベンダー横断比較は実際のデプロイ環境により近いが、短期的には複雑なタスクにおけるモデルのパフォーマンス上限の表示を引き下げる可能性がある。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接