Grok 4がWDCD守約ランキングで94.80点首位、DoubaoProは64.20点で最下位――両者の差は30点超

WDCD v3.1守約テストにおいて、Grok 4は94.80点で首位を獲得し、Doubao Proは64.20点で第11位となり、両者の差は30.6点に達した。

順位の構図とコアデータ

今回のテストは11モデルを対象とし、問題プールにはv3形式の多段階漸進的プレッシャー問題17問とv2アンカー問題8問が含まれる。守約総合スコアは、v3ネイティブ百点制とv2アンカー問題の換算値を等比重で平均して算出し、サンプリング基準はworst-of-3を採用した。Grok 4のR1=1.00、R2=1.00、R3=1.50/2であり、3ラウンドのアンカー問題において最終プレッシャーラウンドでのみ0.5点の失点にとどまったことを示している。DeepSeek V4 Proは93.60点で僅差の2位につけ、R3も同様に1.50/2であった。GLM-4.6とClaude Opus 4.7はそれぞれ93.50点と92.60点で、R3スコアはいずれも1.00/2または1.50/2であった。

下位モデルの差は顕著である。GPT-5.5のR3は0.00/2となり、Gemini 2.5 ProとQwen3 MaxもR3が0.00/2または1.50/2であるが全体スコアは低い。Doubao ProのR1はわずか0.50であり、第1ラウンドの制約注入段階ですでに明確な性能低下が生じていることを示している。

原因分析:R3プレッシャーラウンドが差を生む主因

データによれば、R3プレッシャーラウンドがスコア分化の主要なメカニズムである。上位4モデルのR3平均スコアは1.375/2であるのに対し、下位4モデルのR3平均スコアはわずか0.625/2にとどまる。v3問題の設計では、R3は連続プレッシャーの最終段階に相当し、サンクコスト論法と権威による特別承認の重ね掛けが含まれる。データ境界とセキュリティコンプライアンスのシナリオにおいて、モデルは複数の並行ハード制約を同時に維持する必要があり、R3スコアの低さはS_hold守約サバイバルスコアを直接押し下げる。

Claude Opus 4.7は今回6.8点の改善を記録したが、これは主にR3スコアが前回の低水準から1.50/2へ回復したことによるものであり、スライス式漸進的プレッシャー下での回復能力が向上したことを示す。Gemini 3.1 Proは5.6点下落し、R3スコアがより高い水準からおそらく1.00/2へ低下したことに対応しており、多ラウンドのKBV復唱プローブ後における制約記憶の減衰が速いことを示唆している。

業務プロセス導入における選定上の意味

AIを業務プロセスに組み込む企業は、WDCDスコアに基づいて利用境界を設定できる。Grok 4とDeepSeek V4 Proはエンジニアリング規範およびリソース制限のシナリオでR3スコアが高く、契約条項の自動検証やAPIクォータ制御など、業務ルールを長期にわたって維持する必要があるプロセスへの直接組み込みに適している。Claude Opus 4.7はR3=1.50/2であり、セキュリティコンプライアンスのシナリオで第一候補となり得るが、データ境界のシナリオでは引き続き二次検証の追加設定が必要である。

Doubao ProやQwen3 MaxなどのR3=0.00/2またはR1がすでに低下している下位モデルは、業務ルールおよびセキュリティコンプライアンスのシナリオにおいて制約違反の確率が著しく高まることを意味する。こうしたモデルの使用が不可避な企業は、導入層にハードガードレールを追加すべきである。たとえば、出力前に制約の復唱を強制実行させるか、独立したルールエンジンによるインターセプトを設置するといった対策が有効である。

戦略的評価

現在のデータは、Claudeシリーズの多段階プレッシャー下における回復ポテンシャルを過小評価している可能性がある。Sonnet 4.6とOpus 4.7はいずれも今回6点以上の改善を記録しており、次回以降もR3の安定性を引き続き注視する価値がある。GPT-5.5のR3=0.00/2に対してGPT-o3のR3=0.50/2と、同一メーカーの異なるバージョン間で明確な差が生じており、バージョン更新が守約能力に与える非線形な影響を示唆している。

上位モデルはv3問題のKBV復唱プローブ段階においてより安定した挙動を示し、S_kbvとS_recoverの2項目でより高いスコア貢献を見せている。一方、下位モデルはS_hold段階で早期に失点するケースが多い。次回v3問題においてエンジニアリング規範シナリオの並行制約数が増加した場合、現在R3スコアで上位にある モデルの優位性はさらに拡大する可能性がある。

守約能力はモデルのパラメータに付随するものではなく、そのモデルが長期にわたって業務プロセスに組み込まれ続けられるかどうかを決定するコアとなる閾値である。

データ出典:YZ Index WDCD 守約ランキング | Run #253 · 総合順位 | 評価方法論