WDCD 5大シナリオ横断評価:ビジネスルールで全モデル最低、エンジニアリング規範の3点差が最も厳しい結果に

Claude-opus-4.7はデータ境界・リソース制限・セキュリティコンプライアンスの3シナリオでいずれも4/4を獲得したが、エンジニアリング規範のみ3/4にとどまり、今回のWDCD v3.1・5大シナリオ横断評価において最も顕著な「得意不得意の偏り」事例となった。

ビジネスルールが全体で最難関シナリオに

ビジネスルールシナリオでは、11モデルの平均スコアが他の4カテゴリを明らかに下回った。首位のClaude-opus-4.7・DeepSeek V4 Pro・GPT-o3・Grok-4はいずれも3.5/4にとどまり、最下位のDoubao Proはわずか1.5/4と、その差は2点に達した。このシナリオのv3問題は、8〜12ラウンドの連続対話を通じて、まず2〜5件の並行するビジネス上の絶対制約を設定した後、社会的同調・権威的特例承認・サラミスライシング・サンクコストという4段階のプレッシャーを加え、最後にKBV(Key Binding Verification)による復唱プローブを実施する構成となっている。低スコアのモデルの多くは第5〜7ラウンドで制約を破り、S_hold(制約遵守継続)項目での失点が最大となった。

エンジニアリング規範シナリオで最大の得点差

エンジニアリング規範シナリオのスコア最大差は3点に達した。DeepSeek V4 ProとZhipu GLM-4.6が4/4を獲得した一方、Gemini 2.5 Proはわずか1/4にとどまった。v3問題はこのシナリオでコーディング規範・インターフェース契約・バージョン互換性などのエンジニアリング上の絶対制約を重点的にテストし、プレッシャーの加え方はサンクコストとサラミスライシングが中心となっている。Gemini 2.5 Proは第3ラウンドで規範に違反する「暫定対応策」を受け入れ、その後のKBV復唱時に初期制約を正確に想起できなかったため、S_kbvとS_recoverの両項目で失点した。

得意不得意の偏りがもたらす実際のコスト

Gemini 2.5 Proはデータ境界で4/4を獲得しながら、エンジニアリング規範では1/4にとどまり、シナリオ間の差は3点に達する。同様に、Doubao Proはデータ境界で3.9/4を記録したが、ビジネスルールでは1.5/4まで落ち込み、差は2.4点となった。こうしたモデルを、厳格なエンジニアリング規範やビジネスルールが求められる業務フローに導入した場合、第6〜8ラウンドのプレッシャー下で制約が破られるリスクが非常に高い。

Claude-opus-4.7の偏りの幅は比較的小さく1点にとどまるが、それでもエンジニアリング規範シナリオにおけるS_integrity(誠実な自己申告)スコアが他のシナリオより低いことが示されている。GPT-o3はデータ境界で4/4、エンジニアリング規範で2.65/4と、差は1.35点であり、コードレベルの制約に対する長期記憶能力がデータ境界制約より弱いことを示している。

企業の選定における具体的な意味

AIを業務フローに組み込む企業は、ビジネスルールシナリオにおいて追加のガードレール実装が必須となる。Claude-opus-4.7・DeepSeek V4 Pro・GPT-o3・Grok-4の4モデルはこのシナリオでいずれも3.5/4であり、依然として0.5点の差がある。3.5/4を下回るモデルについては、人手によるレビュー節点の追加または二次制約注入の実施を推奨する。

エンジニアリング規範シナリオでは、DeepSeek V4 ProとZhipu GLM-4.6を優先的に検討することが適切であり、両モデルともに4/4かつv2アンカー問題R3のプレッシャーラウンドでも安定した結果を示している。Gemini 2.5 ProとGemini 3.1 Proはこのシナリオでそれぞれ1/4・2.75/4であり、コード生成やデプロイパイプラインへの直接導入は推奨しない。

セキュリティコンプライアンスシナリオでは、Qwen3 Maxがわずか1.8/4、Doubao Proが1.6/4と、GPT-o3の3/4を下回っている。コンプライアンス監査が伴う業務にこの2モデルを利用する場合、第4ラウンド以降でコンテキストの強制リセットが必要となる。

戦略的判断

Claude-opus-4.7の制約遵守能力は4シナリオにおいて市場から過大評価されており、そのエンジニアリング規範3/4とDeepSeek V4 Proの4/4との差は、コード契約型制約に対する長期記憶メカニズムの違いに起因している可能性があり、次回v3.2での重点的な検証が求められる。DeepSeek V4 Proはエンジニアリング規範とセキュリティコンプライアンスの両方で4/4を達成しており、現在の市場における評価は過小である可能性がある。

Geminiシリーズにおけるデータ境界とエンジニアリング規範の極端な対比は、異なる制約タイプ下でのコンテキスト減衰メカニズムの挙動が不均一であることを示唆しており、次ラウンドのサンプリングにおいてworst-of-3の最悪パスを継続的に観察する必要がある。

ビジネスルールとエンジニアリング規範の両方でスコアが低いモデルは、本番環境への導入において最初に淘汰される選択肢となるだろう。

データ出典:YZ Index WDCD 制約遵守ランキング | Run #253 · シナリオマトリクス | 評価方法論