今回のWDCD v3.1テストにおいて、Gemini 2.5 Proは1回で25.1点上昇、Gemini 3.1 Proは17.4点上昇、DeepSeek V4 Proは97.70点で現時点の最高得点モデルとなった。6モデルでプラスの変化が見られ、Doubao Proのみが6.3点下落した。
データの事実:上昇と下落の正確な分布
Run #316との比較において、今回の評価対象11モデルのうち、Claude Opus 4.7が14.9点上昇、DeepSeek V4 Proが14.1点上昇、GLM-4.6が8.5点上昇、GPT-5.5が9.9点上昇した。Top 5ランキングはDeepSeek V4 Pro 97.70点、Gemini 3.1 Pro 96.70点、Grok 4 96.00点、Gemini 2.5 Pro 94.50点、GPT-o3 94.20点となっている。スコアはworst-of-3方式でサンプリングし、v3問題とv2アンカー問題を等ウェイトで平均して総合スコアを算出している。
要因分析:多ターン圧力下のメカニズムの差異
WDCD v3問題は8〜12ターンの対話を採用し、最初に2〜5件のハード制約を設定した後、社会的同調圧力・権威による特例承認・サラミスライス・サンクコスト圧力を順次加え、最後にKBV復唱プローブと最終ターンの自己申告を行う。Gemini 2.5 ProとGemini 3.1 Proの大幅上昇は、S_hold(制約遵守継続)60点とS_recover(違反後の回復)10点の両方が向上したことによるものと考えられ、連続的な圧力ターンにおいてより遅くまで制約を維持し、かつより速く回復できることを示している。DeepSeek V4 Proの総合スコア97.70点は、データ境界や安全コンプライアンスシナリオにおけるS_kbv(制約記憶)15点での優れたパフォーマンスが寄与していると推測される。Doubao Proの6.3点下落は、S_integrity(誠実な自己申告)15点の減点に起因する可能性があり、違反後の正確な自己報告ができていないことを示し、最終ターンの振り返り段階での弱点を反映している。v2の3ターンアンカー問題(満点4点)の換算部分においても、上昇したモデルはR3圧力ターンでより高いスコアを記録している。
モデル選定の意味:本番環境導入における実際のリスク境界
AIを本番プロセスに組み込む企業にとって、WDCDスコアは許容できる制約強度に直接対応する。DeepSeek V4 ProとGemini 3.1 Proはいずれも96点超であり、リソース制限やビジネスルールのシナリオで追加のガードレールをほとんど必要とせず直接利用できる。Gemini 2.5 Proはスコア94.50点ながら、今回の上昇幅が25.1点と大きく、エンジニアリング仕様など低リスクタスクでの先行試験導入に適している。Doubao ProはTop 5に入っておらず、安全コンプライアンスシナリオを扱う企業はS_recover能力に依存することを避け、独立した検証レイヤーを追加すべきである。すべてのモデルにおいて、データ境界シナリオでは引き続き人手によるレビューを残す必要がある。worst-of-3方式によって最悪ケースのパフォーマンスがすでに露呈しているためだ。
戦略的判断:過小評価と過大評価のシグナル
DeepSeek V4 Proは現在97.70点でトップを走っており、14.1点の上昇幅と合わせると、これまで市場がその制約遵守能力を過小評価していたことが示される。Geminiシリーズの2モデルが同時に大幅上昇したことは、多ターンの段階的圧力に対する基盤的な堅牢性が系統的に改善されたことを示唆している。Doubao Proの6.3点下落は今回唯一のマイナスシグナルであり、次回はサンクコスト圧力ターンにおける具体的なパフォーマンスを重点的に検証する価値がある。Grok 4とGPT-o3は変化データが示されていないものの依然Top 5に留まっており、その基本的な制約遵守能力は競争力を維持している。次のサイクルでは、Claude Opus 4.7とGLM-4.6がそれぞれ14.9点・8.5点の上昇をTop 5入りに転換できるかどうかを重点的に注視する必要がある。
制約遵守能力はもはや静的なラベルではなく、圧力をかけられるたびにリアルタイムで争われる生存競争だ。DeepSeek V4 ProとGeminiシリーズは、誰がより遅くまで違反を防げるかをデータで証明した。
データ出典:YZ Index WDCD 制約遵守ランキング | Run #326 · 変化追跡 | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接