WDCD横断評価:安全コンプライアンスシーンの最低スコアは1.8点、エンジニアリング規範では全モデルが4点満点

WDCD v3.1契約遵守テストにおいて、安全コンプライアンスシーンの全体スコアが最も低く、GPT-5.5とQwen3-Maxはいずれも1.8/4点にとどまった。一方、エンジニアリング規範シーンでは11モデルの最低スコアでも3.2/4点に達しており、両者の差は明確である。

安全コンプライアンスが最難シーンとなるメカニズム

安全コンプライアンスシーンでは、DeepSeek V4 Pro・GPT-o3・Grok-4の3モデルが4/4点を獲得したが、他のモデルは急速にスコアを落とした。GPT-5.5とQwen3-Maxが最下位の1.8/4点、Claude Sonnet 4.6も3.2/4点にとどまった。このシーンでの圧力ラウンドには、コンプライアンス境界への連続的なサラミ戦術と権威による特別承認が含まれており、モデルは第3ラウンド以降に最も崩れやすく、S_hold(契約遵守生存スコア)が大幅に損失する。これに対し、エンジニアリング規範シーンの制約は静的なコードスタイルとバージョン固定が中心で、圧力強度が低いため、全モデルのスコアが3.2〜4/4点に集中した。

最も差が大きいシーンと最も小さいシーン

安全コンプライアンスシーンで最大の差異が見られ、スコアの幅は4/4点から1.8/4点へと2.2点の開きがあった。業務ルールシーンでも差が広がり、DeepSeek V4 ProとGemini 3.1 Proが4/4点を獲得した一方、Doubao Proは1.7/4点にとどまった。エンジニアリング規範シーンでは差異が最も小さく、11モデルのスコアが3.2〜4/4点に集中し、最大差はわずか0.8点であった。これは、エンジニアリング規範の制約が現在のモデルにとってすでに飽和に近い水準に達している一方、安全コンプライアンスでは依然として明確な能力の断層が存在することを示している。

各モデルの得意・不得意と要因

Claude Opus 4.7はエンジニアリング規範とリソース制限でいずれも4/4点を獲得したが、データ境界では2.5/4点にとどまり、1.5点の差が生じた。強みはリソースクォータとコード規範に集中しており、弱点はデータ境界のハード制約における長期記憶にある。GPT-5.5はエンジニアリング規範で4/4点を獲得しながら、安全コンプライアンスでは1.8/4点と2.2点の差があり、コンプライアンス系の多ラウンド圧力下での回復能力が不足していることを示している。Gemini 3.1 Proは業務ルールで4/4点、安全コンプライアンスでは2.4/4点と1.6点の差があり、安全系KBV(知識境界検証)復唱プローブにおける記憶の劣化が速いことが示唆される。Doubao Proはエンジニアリング規範で3.4/4点を獲得したが、業務ルールとデータ境界でいずれも1.7/4点と1.7点の差があり、全体的な契約遵守のベースラインが低い。

企業が本番環境に導入する際のシーン別推奨

AIを本番環境に導入する企業は、データ境界シーンではGPT-o3(4/4点)またはClaude Sonnet 4.6(3.8/4点)を優先し、インターフェース層に二次検証を追加すべきである。リソース制限シーンではClaude Opus 4.7またはGrok-4(いずれも4/4点)をそのまま利用でき、ガードレールの必要性は低い。業務ルールシーンではDeepSeek V4 ProとGemini 3.1 Pro(いずれも4/4点)を推奨するが、Doubao Proにはルールエンジンによるフォールバック機構を追加する必要がある。安全コンプライアンスシーンはリスクが最も高く、DeepSeek V4 ProとGPT-o3を第一候補とし、その他のモデルには必ず人工レビューノードを設置しなければならない。エンジニアリング規範シーンではほぼ全モデルが使用可能であり、追加ガードレールの効果は最小限である。

戦略的判断:能力が過小評価・過大評価されているシグナル

DeepSeek V4 Proは安全コンプライアンス・業務ルール・エンジニアリング規範の3シーンでいずれも4/4点を獲得し、リソース制限のみ2.7/4点であり、その総合的な契約遵守能力は市場に過小評価されている可能性がある。Claude Opus 4.7はリソース制限とエンジニアリング規範で満点を獲得しながら、データ境界では2.5/4点にとどまっており、並列ハード制約下での記憶安定性に弱点があることを示している。GPT-5.5はエンジニアリング規範で満点を獲得しながら安全コンプライアンスで1.8/4点であり、高強度のコンプライアンス圧力下におけるS_recover(回復能力)が宣伝水準に達していないことを示している。次回の検証では、安全コンプライアンスシーンの第8〜10ラウンドのKBV復唱プローブに重点を置き、1.8点モデルが追加のファインチューニングによってS_integrity(整合性スコア)を向上できるか観察すべきである。

安全コンプライアンスシーンでの1.8点は偶然ではなく、多ラウンドのサラミ戦術による圧力を経た後の記憶断裂の必然的な結果である。

企業がモデルを選定する際、単一シーンの満点をもって全シーンでの信頼性と判断してはならず、WDCDの5次元マトリクスに従って各項目を照合する必要がある。エンジニアリング規範はすでに天井に近づいているが、安全コンプライアンスは依然として本番環境での利用可否を決定する重大なボトルネックである。


データ出典:YZ Index WDCD 契約遵守ランキング | Run #263 · シーンマトリクス | 評価方法論