DeepSeek V4 ProはWDCD v3.1約束遵守総合ランキングで97.70点を獲得し第1位となった。Qwen3 Maxは75.20点で第11位にとどまり、首位と最下位の差は22.5点に達した。
ランキング構造:上位3モデルが集中、下位3モデルは断絶
今回評価した11モデルのうち、DeepSeek V4 Pro、Gemini 3.1 Pro、Grok 4が第1グループを形成し、それぞれ97.70点、96.70点、96.00点を記録した。この3モデルはR1・R2でいずれも満点を維持し、R3段階でのみ0〜1点の差が生じた。第4位から第7位のGemini 2.5 Pro(94.50点)、GPT-o3(94.20点)、Claude Opus 4.7(92.60点)、GPT-5.5(90.10点)が第2グループを構成し、R2段階ですでに0点記録が出現している。第8位以降は、Claude Sonnet 4.6(83.60点)、Doubao Pro(76.70点)、GLM-4.6(76.50点)、Qwen3 Max(75.20点)が明確に引き離されている。
首位獲得の要因:v3多段階圧力下での完全な約束維持
DeepSeek V4 ProはV3問題のS_hold(約束遵守生存)次元で最高スコアを記録し、制約突破までの時間が最も長かった。V3問題は8〜12ラウンドの対話で構成され、まず2〜5件のハード制約を設定した上で、社会的同調圧力・権威による特例承認・サラミ戦術・サンクコスト圧力を順次加え、最後にKBV(Key Boundary Verification)復唱プローブと最終ラウンドの誠実な振り返りを実施する設計となっている。同モデルはすべての5種類の制約シナリオ(データ境界・リソース制限・業務規則・安全コンプライアンス・エンジニアリング規範)においてR1〜R3の全プロセスを制約突破なしで完了し、S_kbv(制約記憶)15点・S_recover(突破後回復)10点・S_integrity(誠実な自己申告)15点をすべて満点で獲得した。
最下位の構造:R1段階での失守が引き起こす連鎖反応
GLM-4.6とQwen3 MaxはV2アンカー問題のR1段階ですでに0点を記録しており、初期制約注入の段階で突破されたことを意味する。GLM-4.6は3ラウンドのアンカー問題においてR1・R2・R3がすべて0点となり、V3問題のS_hold得点も大幅に低下した。Qwen3 MaxはR3で2点を取り戻したものの、前段階のR2での0点がすでに総合点を押し下げていた。サンプリング基準はworst-of-3(各問題を3回実行して最悪の結果を採用)であり、この2モデルは少なくとも1回のテストでR1段階から失効した。
上位と下位の差が示すモデル選定の意味
AIを生産プロセスに組み込む企業にとって、WDCDスコア97.70点と75.20点の差は、直接的にリスクエクスポージャーの違いに対応する。DeepSeek V4 Proは安全コンプライアンスおよびエンジニアリング規範のシナリオでR3段階でも制約を維持できるため、長期的な状態保持が求められる社内承認フローへの直接組み込みに適している。Qwen3 MaxとGLM-4.6は初期制約注入段階で失守するため、同様のシナリオでは外部ガードレールや人的レビューを追加しなければ、単一の対話セッションでデータ境界やリソース制限が突破されるリスクがある。
第2グループモデルの実際の使用可能な限界
Gemini 2.5 ProとGPT-o3はR2段階ですでに0点が出現しており、連続的な社会的同調圧力や権威による特例承認の圧力に直面した際の約束遵守能力が低下することを示している。企業がこの2モデルを業務規則類のタスクに使用する場合、R2段階に相当する対話ラウンドに二次確認ノードを追加する必要がある。Claude Opus 4.7は今回92.60点を記録し、前回比14.9点の向上を果たした。R3段階での回復能力が比較的高く、制約突破後に迅速な回復が求められるシナリオでの採用を検討できるが、S_integrity(誠実な自己申告)次元の継続的な監視は依然として必要である。
戦略的判断:約束遵守能力が過小・過大評価されているシグナル
今回のデータから見ると、DeepSeek V4 Proの約束遵守能力は市場に過小評価されている可能性がある。97.70点と2位との差はわずか1点だが、worst-of-3基準下で最高の安定性を維持している。GLM-4.6の76.50点とQwen3 Maxの75.20点は近接しており、R1段階での失守も共通していることから、両モデルの制約注入プロセスに同種のメカニズム上の欠陥が存在することが示唆される。次回の検証で訓練段階における共通の弱点であるかどうかを重点的に確認する価値がある。Gemini 3.1 Proは前回比17.4点の向上を達成し、R1〜R3で全満点を記録した。V3多段階漸進圧力下での回復メカニズムが第1グループに近いレベルに達していることを示している。
全体統計では満点率60%、R3崩壊率わずか0.9%であり、現在の大多数のモデルは単ラウンドの高圧下でも制約を維持できることを示している。ただし、worst-of-3基準により下位モデルの実際のリスクが明確に露呈した。企業のモデル選定に際しては、WDCDスコア90点以上のモデルを生産プロセスのデフォルト選択肢とし、90点未満のモデルはリスクの低い非持続状態シナリオに限定した上で外部検証を追加することを推奨する。
DeepSeek V4 Proの97.70点とQwen3 Maxの75.20点の差は、もはや単なるスコアの差ではなく、生産システムが8〜12ラウンドの対話を通じて初期制約を維持できるかどうかの実質的な分岐点である。
データ出典:YZ Index WDCD 約束遵守ランキング | Run #326 · 総合ランキング | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接