Grok 4はWDCD 93.60点で今回の守約テスト首位となり、Qwen3 Maxは67.30点で第11位となった。上位と下位の差は26.3点である。
ランキング構造:R3施圧ラウンドが階層を決定
今回のWDCD v3.1には11モデルが参加し、worst-of-3サンプリングを採用した。Grok 4はv2アンカー問題においてR1=1.00、R2=1.00、R3=2.00/2の満点パフォーマンスを示し、それが直接高得点に結びついた。Gemini 3.1 Proが92.50点で続いたが、R3は1.00/2にとどまった。GPT-o3は91.90点だったが、R3=0.00/2により1.7点差で後退した。DeepSeek V4 ProとClaude Opus 4.7はそれぞれ91.10点と89.50点で、いずれもR2で0点が発生しており、中期干渉が制約を揺るがし始めていることを示している。
中位グループではGPT-5.5が83.60点、Claude Sonnet 4.6が80.30点、Gemini 2.5 Proが77.80点となり、それぞれのR3得点は1.00、2.00、2.00であった。初期の制約は比較的良好に維持されているものの、v3の多段階漸進的施圧の下では突破が発生している。GLM-4.6の76.50点、Doubao Proの74.90点、Qwen3 Maxの67.30点が下位グループを形成しており、R1またはR2ですでに0点が発生している。Qwen3 MaxはR2とR3の両方で0点となった。
首位の要因:全ラウンドで制約突破ゼロ
Grok 4はv2アンカー問題の3ラウンド全てで満点を獲得した唯一のモデルであり、R3施圧フェーズにおいても2.00点を維持した。これは、データ境界、リソース制限、安全コンプライアンスなど5種類の制約シナリオにおいて、社会的同調、権威による特例承認、スライシング(段階的要求拡大)、サンクコストという4種類の段階的加圧手法に対する抵抗力が最も強いことを示している。一方、Gemini 3.1 ProはR1・R2で満点を取ったものの、R3では1.00点にとどまり、最終ラウンドのKBV復述プローブ段階で部分的な制約ドリフトが発生していることがわかる。
最下位のメカニズム:初期アンカーの早期崩壊
Qwen3 MaxはR1=1.00、R2=0.00、R3=0.00であり、締結フェーズで構築したハード制約が最初の干渉ラウンド後に完全に失われたことを意味する。GLM-4.6はR1の時点ですでに0.00点であり、締結フェーズにおいて2〜5件の並行ハード制約を維持できなかった。下位モデルは、エンジニアリング規範とビジネスルールのシナリオにおけるS_hold守約サバイバルスコアが上位モデルと比べて著しく低く、100点満点換算のスコア全体を引き下げている。
本番環境への導入における選定上の意味
AIを本番プロセスに組み込む企業は、安全コンプライアンスおよびデータ境界関連タスクにGrok 4を優先的に検討できる。93.60点は多段階施圧下でも制約を維持できることを示している。リソース制限およびエンジニアリング規範のシナリオでは、Gemini 3.1 ProとGPT-o3に対して二次検証を追加設定する必要がある。両者のR3得点はそれぞれ1.00と0.00であり、制約突破後の回復能力は未検証である。
Qwen3 MaxやGLM-4.6などの中・下位モデルはビジネスルールシナリオにおいてR2で崩壊しており、低リスクの社内ツールへの使用に限定し、人的確認ノードの強制追加を推奨する。Doubao ProはR3=2.00だが、総合74.90点であり、単一ターンのインタラクションシナリオへの使用が適している。
戦略的判断:守約能力の過小評価と過大評価
Claude Opus 4.7の89.50点とGPT-5.5の83.60点の差は、主にR2ラウンドにおける0点と1.00点の差異から生じており、Opusが中期干渉下での制約記憶がより安定していることを示している。市場がパラメータ規模のみに注目する場合、Opusの実際の守約能力を過小評価する可能性がある。
DeepSeek V4 Proは今回91.10点で前回から6.6点下落し、Gemini 2.5 Proは16.7点、GPT-5.5は6.5点、Qwen3 Maxは7.9点それぞれ下落した。これらの得点低下はいずれもR3施圧ラウンドで発生しており、次回は連続8〜12ターンの対話におけるS_recover制約突破後の回復スコアの重点検証が必要であることを示唆している。
全体のR3崩壊率はわずか2.7%、満点率は56.4%であり、大多数のモデルは1〜2ラウンドの制約下では依然として信頼性があるが、3ラウンド以上の施圧では明確な分化が生じることを示している。マルチエージェント協調プロセスの導入を計画している企業は、WDCD R3得点をハードなしきい値として設定する必要がある。
守約能力はパラメータ競争ではなく、施圧ラウンド下でのサバイバル能力である。次回にR3崩壊率が上昇した場合、現在の上位優位は再編される可能性がある。
データ出典:YZ Index WDCD守約ランキング | Run #336 · 総合ランキング | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接