業務ルールがWDCDの最大弱点に——Qwen3-max 1.55点 vs DeepSeek 4点

WDCD v3.1のパイロットデータによると、業務ルールシナリオは11モデル中で約束遵守生存率が最も低い次元であり、首位のDeepSeek V4 Proが4/4を獲得したのに対し、最下位のQwen3-maxはわずか1.55/4にとどまり、全体の識別力は他の4種類の制約カテゴリを明らかに上回っている。

業務ルールが共通の難点となった理由

業務ルールシナリオの圧力経路には、連続3ラウンドのアンカー干渉と「サラミ戦術」式のルール緩和が含まれる。Qwen3-maxはR3圧力段階でわずか0.55点しか獲得できず、同モデルのエンジニアリング仕様シナリオでの満点4/4を大きく下回り、その差は2.45点に達した。一方、DeepSeek V4 Proは同一シナリオで4/4を維持しており、並行するハード制約に対する記憶保持能力がより高いことを示している。安全コンプライアンスシナリオでも低スコアが見られ、Qwen3-maxが1.6/4、Doubao Proが2/4となっており、制約が内部プロセスではなく外部コンプライアンスに関わる場合、モデルはサンクコスト圧力の下で崩れやすいことを示している。

データ境界シナリオにおける高い一貫性

データ境界シナリオでは、Claude Opus 4.7、Claude Sonnet 4.6、DeepSeek V4 Pro、Gemini 2.5 Pro、GLM 4.6、GPT-o3、Grok 4の7モデルがすべて4/4を獲得し、GPT-5.5のみが3/4で最下位となった。これは、現在の主流モデルが「学習データ境界を漏洩してはならない」といった静的ハード制約に対する約束遵守能力が比較的成熟していることを示しており、S_holdスコアは概ね55点以上となっている。

リソース制限とエンジニアリング仕様における中間的な分化

リソース制限シナリオでは首位のGLM 4.6が3.85/4を達成したのに対し、最下位のQwen3-maxは2.15/4で、差は1.7点となった。エンジニアリング仕様シナリオでは逆転が生じ、Claude Sonnet 4.6、Gemini 3.1 Pro、Qwen3-maxの3モデルが4/4で並び、Doubao Proはわずか2.15/4にとどまった。Gemini 2.5 Proはリソース制限で2.3/4にとどまりながらも、データ境界では4/4を獲得しており、その差は1.7点に上る。これは、「計算リソース上限」と「データ範囲」という2種類の制約に対する処理メカニズムに明確な差異があることを示している。

特定分野偏重モデルの選定リスク

Claude Sonnet 4.6はデータ境界で4/4を獲得しているが、業務ルールではわずか1.8/4にとどまり、差は2.2点に達する。企業のコアプロセスが複雑な業務ルール判定を含む場合、このモデルには追加のルールエンジン・ガードレールが必要となる。Qwen3-maxはエンジニアリング仕様で4/4を獲得しているにもかかわらず、業務ルールと安全コンプライアンスの両シナリオでいずれも1.7/4を下回っており、コードレベルの仕様遵守能力とビジネスロジックの一貫性の間に断絶が存在することを示している。GLM 4.6はデータ境界で4/4を達成しているが、エンジニアリング仕様はわずか2.3/4であり、データセンシティブながらエンジニアリングプロセスが比較的シンプルなシナリオに適している。

本番環境への接続に関する具体的な提言

AIを本番プロセスに接続する企業において、データ境界シナリオではClaude Opus 4.7またはDeepSeek V4 Proを直接使用でき、突破率は比較的低いと見込まれる。業務ルールシナリオでは、DeepSeek V4 Pro以外のモデルに対して独立したルール検証レイヤーを追加することを推奨する。特にQwen3-maxとClaude Sonnet 4.6については注意が必要である。安全コンプライアンスシナリオではGPT-o3とGrok 4が4/4を維持しており、コンプライアンス重視タスクの第一候補となり得るが、それでもR3圧力ラウンド後に人工的なレビューノードを追加する必要がある。

リソース制限シナリオで低スコアとなったモデルは、連続圧力後のS_recoverスコアが概ね6点を下回り、回復能力が不十分である。本番環境ではトークンまたはAPI呼び出し上限の二次検証を明確に設定する必要がある。

戦略的判断

今回のデータは、Qwen3-maxのエンジニアリング仕様能力が市場で過大評価されている可能性を示している。業務ルールシナリオでの1.55/4とエンジニアリング仕様での4/4は鮮明な対比を形成しており、次期v3.2においてビジネス・エンジニアリング混合制約問題を追加して検証する価値がある。DeepSeek V4 Proは業務ルールとデータ境界の両シナリオで満点を獲得しており、約束遵守能力が過小評価されている可能性があり、マルチシナリオの基準モデルとして長期追跡に適している。安全コンプライアンスシナリオの全体的な低スコアは、現在のモデルが「権威による特別許可」類のソーシャルエンジニアリング圧力に対する抵抗力が依然として全般的に不足していることを示しており、企業はこの種のシナリオで人工的なフォールバックを優先的に配置すべきである。

WDCD v3.1のworst-of-3サンプリングはすでに、単一シナリオで満点を取ったモデルに単純に依存することに明確な偏重リスクが存在することを明らかにしている。次の段階では、業務ルールシナリオにおけるS_kbv制約記憶サブ項目の分布を重点的に観察し、モデルが複数の並行ハード制約を真に内面化しているかどうかを判断する必要がある。


データソース:YZ Index WDCD 約束遵守ランキング | Run #233 · シナリオマトリクス | 評価方法論