リソース制限シナリオではgpt-5.5がわずか1.55/4、Doubao-ProはビジネスルールでわずかWDCD v3.1の契約遵守テストにおいて、この2つの具体的な数値はテスト中で最も脆弱な制約タイプを直接示している。
リソース制限が全シナリオ中の最低スコアに
5つのシナリオの中でリソース制限の平均スコアが最も低く、トップのClaude Opus 4.7が4/4を獲得した一方、最下位のgpt-5.5はわずか1.55/4にとどまり、スコア差は2.45点に達した。安全コンプライアンスシナリオも厳しく、Doubao-ProとGPT-5.5が並んで1.65/4を記録した。一方、データ境界シナリオは全体的に最も高く、Gemini 2.5 Pro・Gemini 3.1 Pro・GLM-4.6・Grok-4の4モデルが並んで4/4を獲得した。ビジネスルールシナリオも差が大きく、DeepSeek V4 ProとGPT-5.5はともに4/4であったのに対し、Doubao-Proは1.45/4まで落ち込んだ。
圧力ラウンドが制約記憶の断絶を露呈
WDCD v3では8〜12ラウンドの対話を採用しており、まず契約を確立した後、社会的同調・権威による特別承認・サラミ戦術・サンクコストを段階的に加圧し、最後にKBV(Key Binding Verification)復唱プローブと最終ラウンドでの誠実な自己申告を行う。リソース制限シナリオのスコアが最も低いことは、モデルが3ラウンド以上の継続的な圧力を受けた後に「リソース上限」というハード制約を最も失いやすいことを示している。安全コンプライアンスシナリオも第3ラウンドの加圧段階で大きく失点しており、Doubao-ProとGPT-5.5の1.65/4はこのメカニズムの直接的な結果である。データ境界シナリオは全体的にスコアが高く、「データ範囲」制約が同様の圧力下でもモデルによって長期的に維持されやすいことを示している。
Claude Opus 4.7のリソース制限4/4とビジネスルール2.7/4の1.3点差は、同一モデルが異なる制約タイプにおいて記憶安定性に差があることを露呈している。
偏りのあるモデルが持つ実際のリスク像
スコア差が1点を超えるモデルは9社に上る。Doubao-Proはデータ境界で3.9/4を獲得しながらビジネスルールでは1.45/4と、差は2.45点。GPT-5.5はビジネスルールで4/4ながらリソース制限では1.55/4と、同様に2.45点の差がある。Gemini 2.5 Proはデータ境界で4/4であるのに対し、エンジニアリング標準はわずか2.1/4と、差は1.9点に達する。これらの数値は、モデルが異なるシナリオで示す契約遵守能力が線形的に相関しているわけではなく、企業は単一シナリオの成績から全シナリオのパフォーマンスを推測することができないことを示している。
本番環境導入におけるシナリオ別ガードレール戦略
AIを本番プロセスに組み込む企業は、リソース制限シナリオに対して外部ハード遮断を必ず設置しなければならない。モデル自身の契約遵守能力が最も弱いためである。安全コンプライアンスシナリオも二次審査が必要であり、Doubao-ProとGPT-5.5の1.65/4はすでに合格ラインを下回っている。データ境界シナリオは適度に緩和が可能で、Gemini 2.5 Proなど4モデルの4/4という成績はこの制約が比較的信頼できることを示している。ビジネスルールシナリオはモデルごとに区別して扱う必要があり、DeepSeek V4 ProとGPT-5.5はそのまま使用できるが、Doubao-Proには必ずルールエンジンを追加しなければならない。
市場に過大・過小評価されている契約遵守能力
GPT-5.5はビジネスルールで4/4を獲得しながらリソース制限では1.55/4にとどまり、その全体的な契約遵守能力は市場に過大評価されている可能性がある。Claude Opus 4.7はリソース制限と安全コンプライアンスでともに4/4を獲得しているが、ビジネスルールではわずか2.7/4であり、能力が過小評価されている可能性がある。GLM-4.6はデータ境界とリソース制限でともに4/4、エンジニアリング標準も4/4と、今回のデータにおける総合安定性が最も高い。次回の検証では、リソース制限シナリオの第3ラウンド加圧に注目し、1.55/4と4/4の間に位置するモデルが連続サラミ攻撃を受けた際の実際の限界点を観察することが重点課題となる。
企業がモデルを選定する際は、シナリオ別スコアの順位を直接参考にすることができる。リソース制限ではClaude Opus 4.7またはGLM-4.6を優先し、安全コンプライアンスではClaudeシリーズまたはDeepSeek V4 Proを優先し、ビジネスルールではDeepSeek V4 ProまたはGPT-5.5を優先する。エンジニアリング標準ではGLM-4.6またはDoubao-Proを検討できる。シナリオをまたいだ展開においては、リソース制限と安全コンプライアンスの両方に必ず外部契約遵守レイヤーを追加で展開しなければならない。
契約遵守能力はモデルの汎用的な属性ではなく、シナリオ固有の属性である。この判断はWDCD v3.1の5グループの生スコアから直接導き出されたものである。
データソース:YZ Index WDCD 契約遵守ランキング | Run #242 · シナリオマトリクス | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接