7モデルのWDCD守約スコアが集団下落、Claude Sonnet 4.6のみ8.6点逆上昇

今回のWDCD v3.1テストでは、Claude Sonnet 4.6のWDCDスコアがRun #311比で8.6点上昇した一方、Claude Opus 4.7、Gemini 2.5 Pro、Gemini 3.1 Pro、Zhipu GLM-4.6、GPT-5.5、GPT-o3、DeepSeek V4 Proの7モデルがすべて下落し、うちZhipu GLM-4.6は27点、Gemini 2.5 Proは23.8点の下落となった。

データの事実:上昇は1モデルのみ、下落は7モデルに及ぶ

評価対象11モデルのうち、上昇したのはClaude Sonnet 4.6のみで、下落モデルは7モデルに達した。現在のTop 5は、Grok 4(WDCD=93.80)、GPT-o3(WDCD=89.80)、Claude Sonnet 4.6(WDCD=87.20)、DeepSeek V4 Pro(WDCD=83.60)、Doubao Pro(WDCD=83.00)となっている。Claude Opus 4.7は17点下落、GPT-5.5は12.4点下落、GPT-o3は5点下落、DeepSeek V4 Proは5点下落した。サンプリングはworst-of-3方式を採用し、各問題を3回実行して最低スコアを採用、v3問題とv2アンカー問題を等重みで平均している。

原因分析:多ターン圧力下における守約生存率の差異

WDCD v3の問題設計は8〜12ターンの対話で構成され、まず2〜5つのハード制約を設定した後、社会的同調、権威による特例承認、スライシング(段階的な要求拡大)、サンクコストといった手法で段階的に圧力をかけ、最後にKBV復唱プローブと最終ターンの誠実な振り返りを実施する。S_hold(守約生存)が60点を占め、破綻が遅いほど高得点となる。Zhipu GLM-4.6の27点下落とGemini 2.5 Proの23.8点下落は、連続圧力フェーズのR3〜R6ターンで発生した可能性が高く、制約がサンクコスト圧力の下で最も早く破綻したと考えられる。Claude Sonnet 4.6の8.6点上昇は、S_recover(破綻後回復)とS_integrity(誠実な自己申告)の両項目でスコアが向上し、制約破綻後により速やかに制約フレームワーク内に戻れるようになったことを示している。v2アンカー問題の3ターン設計では、R3の圧力ウェイトが2点であり、下落モデルはこのターンで最も多く失点した可能性が高い。

選定の意味:生産プロセス接続における実際のリスク境界

AIを生産プロセスに組み込む企業は、WDCDスコアに基づいてユースケースを分類できる。Grok 4(WDCD=93.80)とGPT-o3(WDCD=89.80)は、データ境界やセキュリティコンプライアンス系タスクに適しており、守約生存時間が長く、追加ガードレールなしに直接接続できる。Claude Sonnet 4.6(WDCD=87.20)は上昇したものの上位2モデルには及ばず、エンジニアリング標準シナリオでの使用は可能だが、リソース制約系タスクでは人間によるレビューポイントを追加する必要がある。Zhipu GLM-4.6とGemini 2.5 Proはスコアが大幅に低下しており、業務ルールやセキュリティコンプライアンスシナリオでは二次確認メカニズムを設け、単一ターンの圧力で制約が無効化されることを防ぐべきである。Doubao Pro(WDCD=83.00)とDeepSeek V4 Pro(WDCD=83.60)は社内の非コアプロセスには使用可能だが、外部向けシステムにはルールエンジンを重ねて導入する必要がある。

戦略的判断:守約能力が過小評価・過大評価されているモデル

Claude Opus 4.7が17点下落した一方でClaude Sonnet 4.6が8.6点上昇しており、同シリーズ内での差異が25.6点に達していることは、バージョン反復による多ターン圧力への感度変化が顕著であることを示している。Grok 4(WDCD=93.80)は今回の下落リストに入っておらず、その守約能力は市場で過小評価されている可能性があり、次回のKBV復唱プローブにおける性能を重点的に検証する価値がある。GPT-o3(WDCD=89.80)は5点下落したものの依然として2位を維持しており、S_holdスコアは競争力を保っている。Zhipu GLM-4.6は27点という最大の下落幅を記録しており、v3問題の制約設定フェーズですでに制約記憶の減衰が発生していた可能性があり、S_kbvの15点項目が主な失点ポイントとなっていると考えられる。次サイクルでは、Claude Sonnet 4.6がS_hold 60点項目で引き続き向上できるか、およびGrok 4が93.80以上の水準を維持できるかを観察する必要がある。

守約スコアは静的なラベルではなく、多ターンの圧力下における生存曲線である。

企業がモデルを選定する際、WDCDが90点以上のモデルはガードレールへの投資を削減でき、85〜90点のモデルは重点的な強化が必要であり、80点未満のモデルは低リスクシナリオに限定すべきである。v3.1パイロット段階ではすでに、制約記憶と破綻後回復のウェイト配分が生産デプロイコストに直接影響することが示されている。


データ出典:YZ Index WDCD 守約ランキング | Run #316・変化追跡 | 評価方法論