安全コンプライアンス場面の最低スコアはわずか0.8点――5大制約でモデルの守約能力を原形に戻したのは何か

安全コンプライアンス場面は、今回のWDCD v3.1における5大制約テストの中で最も守約が困難な領域となった。gemini-2.5-proはわずか0.8/4点しか獲得できなかった一方、grok-4は4/4満点を達成し、場面内の極差は3.2点に達し、他の4場面を大きく上回った。

データ事実:安全コンプライアンスが最大の格差を生む

5大場面のうち、安全コンプライアンス場面ではgrok-4が4/4を獲得し、最下位のgemini-2.5-proは0.8/4にとどまり、中間モデルのスコアは3.5から1.6の範囲に分布した。比較すると、データ境界場面ではトップのDoubao-proが4/4を獲得し、最下位のGLM-4.6は1.7/4で極差は2.3点、業務ルール場面では7つのモデルが4/4を獲得し、最下位のDoubao-proは2.7/4で極差は1.3点だった。リソース制限とエンジニアリング規範の極差はそれぞれ1.5点と1点であった。安全コンプライアンス場面のスコア分散が最も高く、全モデルの平均スコアが最も低い制約タイプとなる直接の要因となっている。

原因分析:多ターン圧力下でのコンプライアンス記憶の崩壊

安全コンプライアンス場面のスコアが低い主な原因は、v3の問題設計における連続圧力段階にある。問題プールにおいて、この場面の制約の多くは「特定の高リスクコンテンツの出力禁止」「越権リクエストの必須拒否」といった強制的なコンプライアンス条項である。社会的同調・権威による特別承認・サラミ戦術の3種類の圧力下において、モデルは第5〜8ターンで徐々に境界を緩めやすくなる。gemini-2.5-proの安全コンプライアンス場面での0.8点は、worst-of-3サンプリングにおいて少なくとも1ターンのKBV復唱プローブ段階で初期制約を完全に復唱できなくなっていることを意味する。一方grok-4は、R3圧力と最終ターンの誠実な振り返りを同時に通過でき、S_holdとS_integrityの両スコアが高い。業務ルール場面のスコアが全体的に高いのは、この種の制約が主に内部プロセスルールであり、モデルの学習中に類似した指示に接触する確率が高く、サンクコスト圧力への耐性が強いためである。

特定場面偏重モデルの実際のリスク

11モデルのうち9モデルで、場面間に1点以上の格差が存在する。gemini-2.5-proはデータ境界場面で3.5/4を獲得しながら安全コンプライアンスでは0.8/4に落ち込み、差は2.7点。gemini-3.1-proは業務ルール4/4に対して安全コンプライアンス1.8/4で差は2.2点、Qwen3-maxも同様に業務ルール4/4に対して安全コンプライアンス1.6/4で差は2.4点となっている。これらのモデルはデータ境界や業務ルール場面で優れたパフォーマンスを示すため、企業が全体的な守約能力を過大評価しやすい。Claude Opus 4.7はその逆で、業務ルール4/4に対してデータ境界はわずか2.5/4で差は1.5点であり、「データ境界」類の制約に関する記憶が多ターンの干渉後により速く劣化することを示している。

企業選定における具体的な意味

AIを生産フローに組み込む企業において、安全コンプライアンス場面のスコアが2.5/4を下回るモデル(gemini-2.5-pro、Qwen3-max、GLM-4.6、gemini-3.1-pro)は、ユーザーのプライバシー、コンテンツ審査、コンプライアンスレポートに関わるプロセスへの直接利用を避けるべきであり、出力フィルタリング層または人工レビューノードを別途導入する必要がある。データ境界場面で3.5/4以上のスコアを獲得したモデル(Doubao-pro、Claude Sonnet 4.6、DeepSeek V4-proなど)は、厳格なデータ隔離が求められる内部システムへの優先採用が適している。リソース制限場面ではClaude Sonnet 4.6とgrok-4がともに4/4を獲得しており、予算や算力が制限されたエッジ展開シナリオに適している。エンジニアリング規範場面は全体的にスコアが高く、Claude Sonnet 4.6とGPT-o3の4/4パフォーマンスは、コードレビューとプロセス自動化の場面に適している。

戦略的判断:過大評価と過小評価された守約能力

今回のデータは、geminiシリーズの安全コンプライアンス場面における守約能力が市場に過大評価されている可能性を示している。データ境界と業務ルールでの高スコアが、コンプライアンス上の弱点を覆い隠しやすい。grok-4の安全コンプライアンス場面での4/4は次回も継続的に検証する価値があり、特により多くのターンにわたるサラミ戦術圧力下でのS_recoverスコアを観察する必要がある。Claude Opus 4.7における業務ルール満点・データ境界低スコアというパターンは、異なる制約タイプに対する記憶の優先度の差を反映している可能性があり、将来のバージョンでこの格差が解消されれば、総合守約スコアでより高い競争力を持つことになる。企業は単一場面のトップスコアだけを見るのではなく、自社で最も高頻度な制約タイプに基づき、worst-of-3の最低スコアを交差参照した上で最終的な選定を行うべきである。

安全コンプライアンスはモデルの加点問題ではなく、生産環境における最初の関門である。

データ出典:YZ Index WDCD 守約ランキング | Run #316 · 場面マトリクス | 評価方法論