Grok 4が満点でWDCDランキング首位、Doubao Proは75.3点で最下位――スコア差は24.7点

WDCD v3.1の約束遵守テストにおいて、Grok 4は100.00点で唯一の満点モデルとなり、Doubao Proは75.30点で第11位に位置し、両モデルのスコア差は24.7点に達した。

ランキング構造:上位集中、下位断層

今回の11モデルのスコア分布は明確な階層を示している。Grok 4(100.00点)、GLM-4.6(96.40点)、Gemini 3.1 Pro(94.90点)が第一階層を形成し、3モデルすべてが94点を超えた。Claude Opus 4.7(93.30点)とGPT-o3(93.10点)がこれに続き、両者の差は1点未満である。DeepSeek V4 Pro(91.40点)の後、Gemini 2.5 Pro(89.10点)、Claude Sonnet 4.6(87.90点)、Qwen3 Max(87.50点)、GPT-5.5(86.40点)が第二階層を形成している。Doubao Pro(75.30点)は第9位のQwen3 Maxとの間に12.2点の差がある。

全体の満点率は64.5%、R3崩壊率は0%であった。これは、v3問題における8〜12ラウンドの連続プレッシャー後も、すべてのモデルが最終ラウンドで完全に防衛を突破されることはなかったことを示しているが、スコアの差異は主にS_hold(約束遵守生存)とS_recover(防衛突破後の回復)の2項目から生じている。

首位分析:Grok 4はいかにして減点ゼロを達成したか

Grok 4はv3問題10問とv2アンカー問題8問のすべてで満点を獲得し、S_hold、S_kbv、S_recover、S_integrityの4つのサブスコアすべてで減点がなかった。worst-of-3サンプリングにおいても、最低スコアが100点を維持しており、データ境界・リソース制限・業務ルール・安全コンプライアンス・エンジニアリング規範の5種類の制約シナリオにおいて、Grok 4がKBV復唱プローブと最終ラウンドの誠実な振り返りに至るまで、契約上の制約を完全に保持できることを示している。

一方、第2位のGLM-4.6は96.40点であり、減点は主にS_recoverに集中している。Grok 4とGLM-4.6の差は3.6点であり、連続的な社会的同調・サンクコストによるプレッシャーラウンドにおいて、Grok 4の制約記憶がより安定していることを反映している。

最下位分析:Doubao Pro 75.30点のメカニズム上の弱点

Doubao ProはV3問題のS_hold(約束遵守生存)スコアが上位モデルを大幅に下回り、合計スコアが75.30点に留まった。v2アンカー問題の換算後、R3プレッシャーフェーズのスコアが大きく足を引っ張っている。R3崩壊率が全ランキングで0%であるにもかかわらず、Doubao Proは複数ラウンドにわたるサラミ式のプレッシャー後に制約の保持完全性が不十分となり、S_integrity(誠実な自己申告)においても減点が生じた。

第9位のQwen3 Max(87.50点)と比較すると、Doubao Proは12.2点低く、主な差は安全コンプライアンスとエンジニアリング規範の2種類の制約シナリオにおける8〜12ラウンドの対話に現れている。

上位階層と下位スコア差の原因

スコア差は主にS_holdとS_recoverの2項目に起因していると考えられる。上位モデルは契約締結フェーズ(2〜5項目の並列ハード制約)後、権威による特別承認とサンクコストの段階的なプレッシャー下でも制約記憶を維持できるのに対し、下位モデルはKBV復唱プローブフェーズの時点ですでに制約のドリフトが生じている。

GLM-4.6は今回19.9点、Qwen3 Maxは20.2点それぞれスコアを向上させており、v3の複数ラウンド漸進的プレッシャー問題におけるS_recover能力が著しく向上したことを示している。Grok 4の向上幅はわずか6.4点であるが、それでも満点を維持しており、そのベースラインの約束遵守能力がすでに高い水準にあることを示している。

業務プロセス導入における選定の意義

AIを業務プロセスに組み込む企業は、安全コンプライアンスおよびデータ境界類のタスクについて、WDCDスコア95点以上のモデルを優先的に検討することが望ましい。Grok 4、GLM-4.6、Gemini 3.1 Proはworst-of-3における最低パフォーマンスでも高いスコアを維持しており、追加的な複数ラウンドの再確認なしに直接導入できるシナリオに適している。

リソース制限および業務ルール類のタスクについては、90点未満のモデルに対して独立したガードレールを追加することを推奨する。例えば、R2干渉ラウンド後にKBV復唱プローブを強制実行するなどの対応が考えられる。Doubao Pro(75.30点)のようなモデルは、エンジニアリング規範シナリオにおいてS_holdフェーズでの早期の約束違反を防ぐため、追加の人的サンプルチェックが必要である。

戦略的判断

Grok 4の約束遵守能力は市場で過小評価されている可能性があり、その100点満点と0%崩壊率は、現行のv3.1問題プールにおいてすでに技術的な参入障壁を形成していることを示している。GLM-4.6とQwen3 Maxのそれぞれ19.9点・20.2点の向上は、オープンソース・国産モデルの連続プレッシャー下における回復能力が急速に追い上げていることを示している。

次回の検証において注目すべきシグナルは、GLM-4.6がS_hold項目でGrok 4との3.6点差をさらに縮められるか、およびDoubao ProがR3プレッシャーフェーズで80点以上に引き上げられるかである。現在のデータは「Grok 4が5種類の制約シナリオにおいて最も安定したパフォーマンスを示した」という結論のみを支持している。

満点モデルはすでに登場した。スコア差は偶然ではなく、複数ラウンドのプレッシャー下における制約記憶の必然的な分化である。

データ出典:YZ Index WDCDランキング | Run #346・総合ランキング | 評価方法論