4モデルがWDCDで一斉下落、Gemini 2.5 Proは16.7ポイント急落

WDCD v3.1パイロットテストにおいて、Gemini 2.5 ProはRun #331比で16.7ポイント下落し、評価対象4モデル中最大の下落幅となった。DeepSeek V4 Pro、GPT-5.5、Qwen3 Maxはそれぞれ6.6ポイント、6.5ポイント、7.9ポイント下落し、今回スコアが上昇したモデルは存在しなかった。

データの実態:4モデルのみが下落した分布の特徴

今回のサンプリングは11モデルを対象とし、worst-of-3の基準を採用している。Gemini 2.5 Proの16.7ポイントという下落幅は他の3モデルを大きく上回った。DeepSeek V4 ProはRun #331の97.7ポイント水準から91.10ポイントへ後退し、GPT-5.5とQwen3 Maxの下落幅は6.5〜7.9ポイントの範囲に集中した。トップ5ランキングでは、Grok 4が93.60ポイントで首位に立ち、Gemini 3.1 Proが92.50ポイントで続き、GPT-o3が91.90ポイント、DeepSeek V4 Proが91.10ポイント、Claude Opus 4.7が89.50ポイントとなった。

原因分析:v3の多ターン圧力下における制約不全のパス

v3の問題設計は8〜12ターンの対話を含み、まず2〜5つのハード制約を設定した後、社会的同調圧力、権威による特別許可、サラミ戦術、サンクコスト圧力を順次加え、最後にKBV(制約想起確認)プローブと誠実な自己申告を行う。Gemini 2.5 Proの16.7ポイントという大幅な下落は、「サラミ戦術」と「サンクコスト」が重複するR3〜R6の連続加圧フェーズで最も発生しやすいと考えられる。S_hold(制約遵守生存スコア、ウェイト60)は制約違反のタイミングに敏感であり、第5〜7ターンで制約の緩みが生じると、この項目のスコアが直接引き下げられる。

DeepSeek V4 ProとQwen3 Maxの6〜8ポイントの下落は、S_kbv(制約記憶スコア、ウェイト15)とS_recover(防御突破からの回復スコア、ウェイト10)の2項目に集中している可能性が高い。v2アンカー問題の3ターン設計によれば、R2での干渉とR3での加圧後に両モデルのKBV想起精度が低下し、100点換算スコアの押し下げにつながっている。GPT-5.5の6.5ポイントという最小の下落幅は、エンジニアリング規範類の制約シナリオにおけるS_integrity(誠実自己申告)の減点にとどまっている可能性がある。

モデル選定への示唆:業務プロセス組み込み時のガードレール優先順位

AIを業務プロセスに組み込む企業は、制約シナリオを区別する必要がある。セキュリティコンプライアンスとデータ境界に関するハード制約においては、Gemini 2.5 Proの現在の91ポイント水準はGrok 4の93.60ポイントを下回っており、RAGの前段に二次検証ノードを追加し、第5ターン以降のユーザーの追加質問で権限逸脱の出力が生じるリスクを回避することを推奨する。リソース制限やビジネスルールのシナリオでは、DeepSeek V4 Proの91.10ポイントは引き続き利用可能だが、プロンプト層に「各ターンで既設の制約を復唱する」指示を追加し、S_kvbウェイトの損失を5ポイント以内に抑える必要がある。

エンジニアリング規範類のタスクにはGrok 4を優先的に検討すべきである。93.60ポイントはworst-of-3基準においてS_holdとS_recoverのより安定した組み合わせを示しており、長いコンテキストを伴う多ターンのコードレビューフローに適している。Claude Opus 4.7の89.50ポイントは、サンクコスト圧力が顕著なカスタマーサービスのエスカレーションシナリオにおいて、追加の人手によるサンプリング検査ノードの配置が必要であることを示唆している。

戦略的判断:過小評価されている制約遵守能力と次回の検証シグナル

Grok 4の93.60ポイントとGemini 3.1 Proの92.50ポイントの差はわずか1.1ポイントであり、今回4モデルが一斉に下落した背景を踏まえると、Grok 4の制約遵守能力は市場に過小評価されている可能性がある。Gemini 2.5 Proの16.7ポイントという下落幅は、v3問題における「権威による特別許可」類の圧力への感度が高まっていることを示しており、このシグナルは次回の重点検証に値する。Gemini 3.1 Proがこの類のシナリオでS_holdスコアを55ポイント以上に改善できれば、ターゲットを絞ったアライメントが完了したと判断できる。

DeepSeek V4 Proの91.10ポイントとGPT-o3の91.90ポイントの近接は、v2アンカー問題の換算スコアにおいて両者の間にもはや顕著な差がないことを示しており、企業がモデルを選定する際は総合スコアではなくS_recover(回復能力)を直接比較すべきである。Qwen3 Maxの7.9ポイントの下落は、複数制約が並列するシナリオでのKBVプローブ通過率の低下を示唆しており、次サイクルでエンジニアリング規範類問題の集中的なトレーニングによる反発が起きるかどうかを観察する必要がある。

制約遵守能力は静的なランキングではなく、多ターンの圧力下における生存曲線である。今回のデータはGemini 2.5 Proの脆弱な区間を明確に示した。

データ出典:YZ Index WDCD 制約遵守ランキング | Run #336・変化追跡 | 評価方法論