Grok 4が95.69点でWDCD首位、Qwen3 Maxは73.48点で最下位——両者の差は22点超

Grok 4はWDCD v3.1守約テストで95.69点を獲得し第1位となった。Qwen3 Maxは73.48点で最下位となり、両者の差は22.21点に上る。

ランキング構造:上位に集中、下位に断層

今回のWDCDランキングでは、上位5モデルがいずれも86点以上を記録した。内訳はGrok 4(95.69点)、Gemini 3.1 Pro(88.14点)、GLM-4.6(87.55点)、DeepSeek V4 Pro(86.62点)、Claude Opus 4.7(86.34点)である。6位から10位は82〜84点台に集中しており、GPT-5.5が84.24点、GPT-o3が84.07点を獲得した。下位3モデルはQwen3 Maxの73.48点、Doubao Proの76.38点、Gemini 2.5 Proの77.69点となっており、上位との間に明確な断層が形成されている。

全体統計では満点率57%、R3崩壊率9.4%となった。サンプリングはworst-of-3方式を採用し、各問題を3回実行して最低スコアを採用。採点はルールベースで行われ、AIによる裁定はゼロである。

首位分析:R3加圧下におけるGrok 4の生存優位性

Grok 4はR1=1.00、R2=1.00、R3=1.38/2を記録し、v3問題における守約生存スコアへの貢献が際立っている。v3問題は8〜12ターンの対話で構成されており、まず2〜5件のハード制約を設定し、その後、社会的同調・権威による特別承認・サラミスライス・サンクコスト圧力を順次加え、最後にKBV(Key Behavioral Verification)復唱プローブと誠実な自己申告を行う設計となっている。Grok 4はR3段階においても高いスコアを維持しており、連続加圧シナリオにおける制約の記憶力と回復能力の高さを示している。

その要因として、データ境界および安全コンプライアンス系の制約に対する処理メカニズムが挙げられる。多ターンにわたる段階的加圧において防御が崩れるタイミングが遅く、S_holdスコアが相応に向上している。

最下位分析:Qwen3 MaxのR3パフォーマンスと記憶減衰

Qwen3 MaxはR1=1.00、R2=0.75、R3=0.63/2を記録しており、R3スコアが上位モデルと比べて明らかに低い。v2アンカー問題の3ターン設計においてR3の配点は2点であり、その低スコアが総合点を直接引き下げている。考えられる原因は、リソース制限やエンジニアリング規範のシナリオにおいて、連続した干渉を受けた後に制約の記憶がより速く減衰し、S_kbvおよびS_recoverのスコアに影響が出ることである。

14位のDoubao Pro(R1=0.75)と比較すると、Qwen3 MaxはR1では満点を獲得しているものの、R3はより低い。これは、制約設定フェーズでは正常に機能しているが、問題が後期の加圧ターンに集中していることを示している。

上位層と下位層の差が示すモデル選定上の意味

AIを業務プロセスに組み込む企業にとって、WDCDスコアの差異は利用可能なシナリオに直接影響する。Grok 4やGemini 3.1 Proなどの上位モデルは5種類の制約シナリオにおいて守約の生存時間が長く、データ境界や安全コンプライアンス要件が高い場面——例えば金融リスク管理ルールの執行や医療コンプライアンス審査——に適している。

Qwen3 Maxなどの下位モデルは多ターンの加圧下でR3スコアが低いため、業務ルールやリソース制限のシナリオでは外部ガードレールを追加することを推奨する。たとえば二次検証や人的レビューのチェックポイントを設け、サンクコスト圧力によって制約が段階的に突破されるリスクを回避すべきである。

具体的な判断基準として、企業のコアプロセスが8ターン以上の連続インタラクションを含む場合はR3スコアが1.0以上のモデルを優先すること。R3スコアが0.8未満のモデルは単一ターンまたは低加圧シナリオに適しており、サーキットブレーカー機構の設定が必要である。

戦略的判断:守約能力が過小・過大評価されうるシグナル

GLM-4.6は前回比26.0点上昇、GPT-5.5は10.5点上昇しており、一部モデルがv3多ターン段階的加圧問題において大きな改善余地を示している。分析によれば、GLM-4.6のスコア向上はKBV復唱プローブと誠実な自己申告フェーズの最適化によるものと考えられ、次回以降もエンジニアリング規範シナリオにおける安定性を継続検証する価値がある。

GPT-o3のR3は0.25/2にとどまり、同系列のGPT-5.5の0.75/2との差が顕著である。これは権威による特別承認の加圧下での回復能力が相対的に弱いことを反映している可能性があり、次回の重点観察項目として注目すべきシグナルである。

Claude Opus 4.7とClaude Sonnet 4.6のスコアはそれぞれ86.34点と80.31点であり、同系列内での差が6点以上に達している。これは、異なるパラメータ規模が守約タスクにおいてパフォーマンスに差異をもたらすことを示唆しており、実際の導入選定時にはシリーズ単位でまとめて評価するのではなく、個別にテストする必要がある。

守約能力は静的なラベルではなく、多ターンの加圧下における動態的な生存曲線である。企業がモデルを選定する際は、平均スコアではなくR3スコアを核心的な閾値とすべきである。

データ出典:YZ Index WDCDランキング | Run #360 · 総合ランキング | 評価方法論