WDCD v3.1の5大場景横断評価において、ビジネスルール場景は全モデルのスコアが最も低い赛道となり、Qwen3-maxはわずか1.55/4点にとどまり、Gemini 2.5 Proの3.85/4点を大きく下回った。
ビジネスルール場景がなぜ最難関となるのか
ビジネスルール場景の首位であるGemini 2.5 Proも3.85/4点にとどまり、最下位のQwen3-maxは1.55/4点と、最大差は2.3点を超えた。一方、データ境界場景では4モデルが同時に満点4/4を獲得し、安全コンプライアンス場景でも3モデルが満点を達成している。ビジネスルール場景の負荷設計には、連続複数ラウンドにわたる社会的承認戦略とサラミスライス戦略が含まれており、モデルが並列的なハード制約のもとで段階的に制約を緩めやすくなっている可能性がある。Qwen3-maxの当該場景における低スコアは、総合的な契約遵守パフォーマンスを直接的に引き下げている。
リソース制限場景における第二の圧力
リソース制限場景も同様に難度が高く、Claude Opus 4.7はわずか2/4点にとどまり、この場景の最下位となった。Zhipu GLM-4.6は4/4点でトップに立ち、Gemini 2.5 Proは3.7/4点であった。Claude Opus 4.7はデータ境界場景で4/4点を獲得しながら、リソース制限場景では2/4点に落ち込み、同一モデルにおける場景間のスコア差は2点に達した。これは、制約の種類が異なれば、同一モデルに対する契約遵守能力の要求にも明確な差があることを示している。リソース制限場景のv3における複数ラウンドの漸進的な圧力負荷は、サンクコスト効果をより早期に引き起こす可能性があり、R3フェーズにおいてモデルが制約を破りやすくなっている可能性がある。
モデルの得意・不得意分野の実際の分布
場景間スコア差が1点を超えるモデルは合計8モデルに上った。Claude Opus 4.7はデータ境界の4/4とリソース制限の2/4の間で最大の落差を形成し、Doubao Proはデータ境界が4/4であるにもかかわらずビジネスルールはわずか2/4と、差は同じく2点に達した。Qwen3-maxはデータ境界の3.7/4とビジネスルールの1.55/4の差が2.15点に及んだ。GPT-5.5はエンジニアリング規範で4/4を獲得しながら、安全コンプライアンス場景ではわずか2.4/4にとどまり、差は1.6点であった。これらのデータは、5種類の制約場景すべてにわたって均衡の取れた高い水準を維持できるモデルが存在しないことを示している。
企業が本番システムにAIを組み込む際の選定上の示唆
AIを本番システムに組み込む企業は、具体的な場景に応じてモデルを選定する必要がある。データ境界および安全コンプライアンス場景では、Claude Opus 4.7とGrok 4がいずれも安定して4/4を獲得しており、機密データ処理やコンプライアンス審査への優先採用が検討できる。リソース制限場景ではClaude Opus 4.7の使用を避け、Zhipu GLM-4.6またはGemini 2.5 Proを採用すべきである。ビジネスルール場景では、Gemini 2.5 Proの3.85/4が比較的安定したパフォーマンスを示している一方、Qwen3-maxの1.55/4は、この種の制約下では追加のガードレールや二次検証が必要であることを意味する。
エンジニアリング規範場景では、Claude Sonnet 4.5、Doubao Pro、Zhipu GLM-4.6を含む5モデルが4/4を獲得しており、コードレビューやプロセス管理の場面に適している。複数の場景を同時に扱う企業は、単一モデルが不得意な場景でリスクに直接さらされることを避けるために、モデルルーティング機構を用意する必要がある。
戦略的判断と次回検証シグナル
Claude Opus 4.7のデータ境界と安全コンプライアンス場景における満点パフォーマンスは、市場において全場景で信頼できるモデルとして過大評価されている可能性があるが、リソース制限における実際の2/4点は、契約遵守能力に明確な弱点が存在することを示している。Qwen3-maxのビジネスルール場景における極めて低いスコアもまた、その総合的な契約遵守能力が過小評価される要因になりかねない。Zhipu GLM-4.6はリソース制限とエンジニアリング規範の両場景で4/4を獲得しており、次回以降も複数ラウンドの圧力下における回復能力の継続的な観察が値する。
今回の試験的サンプリングはworst-of-3の基準を採用している。今後v3問題のKBV再現プローブラウンドを追加した場合、得意・不得意の偏りを持つモデルのS_kbvとS_recoverのスコア変化が重要な検証シグナルとなる。企業がモデルを選定する際は、単一の総合ランキングのみを参照するのではなく、場景別スコアの差異をハードな入力条件として扱うべきである。
すべての制約場景で同時に満点を取れるモデルは存在しない。モデル選定の本質は、リスクを最も適合したモデルに割り振ることにある。
データ出典:YZ Index WDCD 契約遵守ランキング | Run #276 · 場景マトリクス | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接