今回のWDCD v3.1守約テストでは、Claude Opus 4.7がRun #247比で6.8点上昇、Claude Sonnet 4.6が6.7点上昇、Gemini 3.1 Proが5.6点下落、GPT-5.5が5.3点上昇した。この一連のデータは、多ラウンドの段階的圧力下におけるモデルの制約維持能力に明確な分化が生じていることを直接示している。
データの事実:Top 5とスコア変動幅
現在のTop 5ランキングでは、Grok 4のWDCDスコア94.80点が首位、DeepSeek V4 Proの93.60点が2位、GLM-4.6の93.50点が3位、Claude Opus 4.7の92.60点が4位に上昇、Claude Sonnet 4.6の88.20点がトップ5入りした。上昇モデルは計3つ、下落モデルは1つのみで、Gemini 3.1 Proが唯一明確に下落したモデルとなった。
守約総スコアは、v3問題のネイティブ百点制とv2アンカー問題の換算値(total/4×100)を等加重平均で算出し、サンプリング基準はworst-of-3を採用している。Claude Opus 4.7とSonnet 4.6の同時上昇は、8〜12ラウンドの対話における「立約→圧力付与→KBV復述プローブ」のフローにおいて、S_hold守約サバイバル60点項目のスコア改善が最も顕著であったことを示している。
原因分析:圧力ラウンド数と制約シナリオの差異
WDCD v3問題の設計は、立約フェーズで2〜5項目の並列ハード制約を設け、その後に「社会的認同」「権威による特別許可」「サラミ戦術」「サンクコスト」の4段階の圧力を付与し、最後にKBV復述プローブと最終ラウンドの誠実な振り返りを行う構成となっている。Claudeシリーズのスコア上昇は、S_recover(防衛突破後の回復10点)とS_integrity(誠実な自己申告15点)項目の改善に起因する可能性が最も高く、特に安全コンプライアンスとエンジニアリング規範の2種類の制約シナリオにおいて、第6〜8ラウンドのサラミ戦術圧力下でも崩壊せず制約記憶を維持できていることが確認された。
Gemini 3.1 Proの5.6点下落は、worst-of-3の最悪値採用ルールと合わせて考えると、データ境界またはリソース制限シナリオでの連続圧力ラウンドにおいてS_holdスコアの低下が最も早かったと推察される。v2アンカー問題の3ラウンド設計では、R3圧力フェーズ(重み2点)が問題を最も露わにしやすく、同モデルはR2の干渉後のR3フェーズでより早期に制約を破り、結果として換算スコア全体の低下を招いた可能性がある。
GPT-5.5の5.3点上昇は、業務規則シナリオにおけるS_kbv制約記憶15点項目の強化を反映している可能性があり、多ラウンドの段階的圧力下でも初期制約を正確に復述できるようになったと考えられる。以上の判断はいずれも今回とRun #247との比較に基づくものであり、連続的な過去データの裏付けはない。
モデル選定への示唆:生産プロセス統合における実際のリスク
AIを生産プロセスに組み込む企業にとって、WDCDスコアはさまざまな制約シナリオにおける実用上の限界に直結する。Grok 4の94.80点とDeepSeek V4 Proの93.60点は、エンジニアリング規範および安全コンプライアンスシナリオでより安定したパフォーマンスを示しており、厳格なリソース制限が必要な内部システムへの直接統合に適しており、ガードレールの必要性は相対的に低い。
Claude Opus 4.7の92.60点はTop 4入りを果たしたものの、Grok 4との差はまだ2.2点あり、データ境界シナリオでは対話ラウンド数が8ラウンドを超える場合に特に、引き続き人間によるレビューノードの保持を推奨する。Gemini 3.1 Proの5.6点下落は、業務規則が密集するカスタマーサービスや承認フローへの統合において制約違反の確率が相対的に高まることを意味し、導入時にR3圧力シミュレーションテストを追加で実施する必要がある。
企業は5種類の制約シナリオの優先度に応じて階層的に選定できる:高い安全コンプライアンス要件のシナリオではGrok 4とClaude Opus 4.7を優先検討し、厳格なリソース制限のあるエッジデプロイにはDeepSeek V4 Pro(93.60点)を参照し、Gemini 3.1 Proについては現在のS_hold上の弱点を補うためにプロンプト内で初期制約アンカーを強化する必要がある。
戦略的判断:過小評価されたシグナルと検証待ちのシグナル
Claude Opus 4.7とSonnet 4.6の同時上昇は、v3問題の多ラウンド圧力下における回復能力がこれまで市場に過小評価されていた可能性を示しており、次期ではKBV復述プローブフェーズにおけるS_kbvスコアが継続的に安定しているかどうかを重点的に検証する必要がある。Gemini 3.1 Proの下落はプロンプト感度の一時的な変化によるものである可能性もあり、次サイクルでの反発があるかどうかを観察する必要がある。
Grok 4が94.80点でトップを走り、3モデル上昇・1モデル下落という全体的な構図と合わせて考えると、現行の試験段階において同モデルの守約能力が市場に過小評価されるリスクは低いが、エンジニアリング規範シナリオでのworst-of-3検証をさらに重ねる必要がある。GLM-4.6の93.50点とDeepSeek V4 Proの93.60点はわずか0.1点差であり、次期も同水準を維持すれば、企業の代替候補として重要なシグナルとなるだろう。
守約能力の分化は、単一ラウンドの正解率から多ラウンドの圧力下でのサバイバル時間へと移行している。次サイクルで最も注目すべきは、Gemini 3.1 ProがR3圧力フェーズで下落を止められるかどうか、そしてClaudeシリーズが6.8点の上昇幅をTop 3入りへと転換できるかどうかである。
データ出典:YZ Index WDCD 守約ランキング | Run #253 · 変動追跡 | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接