Grok 4が93.80点でコンプライアンス遵守首位、Doubao Proが67.30点で最下位——両者の差は26.5点

WDCD v3.1コンプライアンス遵守テストにおいて、Grok 4は93.80点で11の評価対象モデル中最高得点を獲得し、Doubao Proは67.30点で最下位となった。両者の差は26.5点に及ぶ。v2アンカー問題では、Grok 4がR1・R2・R3の3ラウンド全てで満点(1.00/1.00/1.00)を獲得した一方、Doubao ProはR3でわずか0.00/2点にとどまった。

順位構造:上位3強と下位の断絶

上位3モデルであるGrok 4(93.80点)、GLM-4.6(92.00点)、DeepSeek V4 Pro(90.90点)は明確な第一集団を形成し、4位のGPT-o3(87.10点)との差は3.8点以上に開いた。下位ではQwen3 Max(71.00点)、GPT-5.5(68.60点)、Doubao Pro(67.30点)の3モデルがいずれも72点を下回り、上位3モデルの平均点92.23点と比較すると、差は20点を超える。

全体の満点率は51.8%、R3崩壊率はわずか3.6%であり、大多数のモデルが単一ラウンドの高圧下では制約を維持できる一方、多ターンにわたる段階的プレッシャーを受けると差異が急速に拡大することが示された。

首位Grok 4:v2アンカー全満点の背後にあるメカニズム

Grok 4はv2の3ラウンドアンカー問題においてR3で1.00/2点を獲得し、v3問題のS_hold(60点項目)における高い保持率と合わせて、合計93.80点を達成した。データ境界とセキュリティコンプライアンスの2種類の制約シナリオにおいて、連続8〜12ターンの対話で制約突破の記録は一切見られなかった。これに対し、最下位のDoubao Proは同じv2 R3セクションで0点を記録しており、権威による特別承認プレッシャーの下で最も早く制約を失ったことが示された。

最下位Doubao Pro:R3ゼロ点が露呈した回復能力の弱点

Doubao Proの67.30点の内訳では、S_recover(制約突破からの回復、10点項目)とS_integrity(自己申告の誠実さ、15点項目)の得点が低かった。v3問題の設計では最終ラウンドでの誠実な振り返りが求められるが、Doubao ProはKBVプローブによる確認後に初期制約を正確に再現できず、S_kbv(制約記憶、15点項目)で大きな失点となった。worst-of-3サンプリング方式により、最も悪い一回のパフォーマンスがさらに強調される結果となった。

上位集団 vs 下位集団の差:プレッシャーターン数が決定要因

DeepSeek V4 ProはR3で満点(2.00/2)を獲得したものの、総合得点はGrok 4に2.9点届かず、その差は主にv3多ターン段階的プレッシャー下のS_hold(生存スコア)に起因する。GLM-4.6は今回、前回比13.7点上昇したが、これは主にR2干渉ラウンドの得点が低水準から1.00へ回復したことによる。

下位3モデルは「サラミスライシング」と「サンクコスト」による段階的プレッシャーシナリオにおいて、R3の平均得点がわずか0.67/2にとどまった一方、上位3モデルの平均R3得点は1.33/2であった。この差は単一ラウンドの崩壊ではなく、多ターンの累積による制約記憶の劣化から生じている。

原因分析:制約シナリオとプレッシャーターン数の交互作用

5種類の制約シナリオのうち、リソース制限とエンジニアリング規範シナリオで制約突破率が最も高かった。v3問題の8〜12ターン設計により、社会的同調と権威による特別承認のプレッシャー効果が重畳し、S_holdスコアが7ターン目以降に明確な分化を示した。worst-of-3サンプリングによると、上位モデルは最悪の一回でも85点以上を維持できた一方、下位モデルは最悪の一回が60点を下回った。

モデル選定の意味:業務プロセス組み込みにおける実際のリスク

AIを業務プロセスに組み込む企業は、データ境界とセキュリティコンプライアンスのシナリオにおいてGrok 4とGLM-4.6を優先的に検討できる。これらのモデルのS_hold得点は、連続多ターンにわたる制約保持を裏付けている。リソース制限シナリオでは、DeepSeek V4 ProとGPT-o3に対して追加の二次検証ガードレールを設ける必要がある。両モデルのR2干渉ラウンド得点はそれぞれ1.00と0.00であった。

業務ルールとエンジニアリング規範シナリオでは、Claude Opus 4.7(85.80点)とClaude Sonnet 4.6(81.50点)が中間的な選択肢となり得るが、サンクコストによるプレッシャーラウンドでは人手によるレビューポイントの追加が必要となる。Doubao ProとGPT-5.5は70点を下回っており、人手によるフォールバックなしの業務チェーンへの直接投入は推奨しない。

戦略的判断:過小評価と過大評価のシグナル

GLM-4.6は今回13.7点上昇しR3で満点を獲得しており、その制約遵守能力は市場に過小評価されている可能性がある。次回の検証では、v3問題のS_recover項目が継続的に安定しているかどうかに注目すべきである。GPT-o3は今回6.9点下落しR2で0点を記録しており、制約記憶が干渉ラウンドで劣化を示している。これがバージョン変動によるものかどうかを引き続き観察する必要がある。

Grok 4が現時点で93.80点のリードを保てている主な要因はv2アンカー全満点にある。次回のv3問題でより多くの並列ハード制約が追加された場合、S_hold(60点項目)が引き続き高水準を維持できるかが重要な観察ポイントとなる。R3崩壊率がわずか3.6%という低水準は、次バージョンのテストがターン数を増やすことでモデル間の差をさらに拡大させる可能性を示唆している。

制約遵守能力はモデルのパラメータの付随物ではなく、業務適用可能性を決定する基礎的な閾値である。

データ出典:YZ Index WDCD コンプライアンス遵守ランキング | Run #242 · 総合ランキング | 評価方法論