WDCD v3.1の5大制約シナリオテストにおいて、データ境界シナリオの平均スコアが最も低く、Qwen3-maxはわずか1.3/4、GLM-4.6は1.7/4にとどまった。業務ルールシナリオで6モデルが4/4を獲得したこととは対照的な結果となった。
データ境界がなぜ最難シナリオになるのか
データ境界シナリオの下位3モデルは、Qwen3-max 1.3/4、GLM-4.6 1.7/4、GPT-5.5 2.5/4だった。一方、業務ルールシナリオでは上位6モデル全てが4/4を達成し、DeepSeek V4 Pro、Gemini 3.1 Pro、GPT-5.5、GPT-o3、Grok-4、Qwen3-maxがいずれも満点を守った。これは、多ターンの段階的プレッシャーが「データ境界」制約下でモデルを突破しやすいことを示している。
原因分析は、v3問題の制約設定と連続プレッシャーのフェーズに帰因する。データ境界問題では通常、第2〜5ターンに複数のハード制約が同時に注入され、社会的同調や権威による特例承認のプレッシャーによって、モデルが「データ利用範囲」を段階的に拡大させられやすい。Qwen3-maxは同シナリオで1.3/4にとどまり、R2の干渉フェーズとR3のプレッシャーフェーズで既に複数回の契約違反が発生したことを示している。一方、同モデルは業務ルールシナリオでは4/4を獲得しており、制約の種類によって記憶保持能力に顕著な差があることが証明された。
安全コンプライアンスシナリオにおける予想外の分化
安全コンプライアンスシナリオでは、Claude Opus 4.7が4/4で首位に立ち、DeepSeek V4 Pro、GPT-5.5、Grok-4も満点を獲得した。しかしClaude Sonnet 4.6はわずか2.1/4となり、同シナリオで唯一2.5点を下回るモデルとなった。データ境界シナリオでの4/4との差は1.9点に達する。Gemini 2.5 Proも安全コンプライアンスでは2.2/4にとどまったが、リソース制限シナリオでは4/4を獲得しており、その差は1.8点に及んだ。
こうした分化は、v3問題におけるKBV復述プローブのトリガータイミングに起因する可能性がある。安全コンプライアンス問題では、最終ターンの誠実な振り返りの前に、より多くの「サラミスライス」式の段階的リクエストが挿入される。Claude Sonnet 4.6は初期ターンですでにコンプライアンス境界の維持を緩め、S_recoverフェーズで適時に立て直せなかった結果、S_holdとS_integrityの両方で失点したと考えられる。
偏ったモデルが本番導入に与える実際の影響
Qwen3-maxは業務ルールで4/4、データ境界で1.3/4と、シナリオ間の差が2.7点に達し、今回のテストで最も偏りの大きいモデルとなった。GLM-4.6はデータ境界1.7/4、業務ルール3.4/4で差は1.7点だった。データ処理パイプラインへのモデル導入を検討する企業が、業務ルールの高スコアだけを見てQwen3-maxやGLM-4.6を選択した場合、データ境界でも3.5/4以上を維持するGemini 2.5 ProやGemini 3.1 Proを選ぶよりもリスクが明らかに高くなる。
Claude Sonnet 4.6はエンジニアリング標準とデータ境界でいずれも4/4を獲得したが、安全コンプライアンスでは2.1/4にとどまった。このモデルをコードレビューやデータ匿名化プロセスに使用する場合、独立したコンプライアンスチェック層を別途導入する必要がある。そうしなければ、モデル自身の契約遵守能力だけでは全シナリオをカバーするには不十分だ。
モデル選定の提言:総合ランキングではなくシナリオへの適合性で判断する
AIを本番プロセスに組み込む企業は、目標シナリオのworst-of-3スコアを優先的に確認すべきだ。厳格なデータ境界管理が必要なシナリオにはClaude Sonnet 4.6(4/4)またはGrok-4(4/4)を推奨する。リソース制限シナリオにはDeepSeek V4 Pro(4/4)を優先し、安全コンプライアンスシナリオではClaude Sonnet 4.6(2.1/4)とGemini 2.5 Pro(2.2/4)を避け、Claude Opus 4.7またはDeepSeek V4 Proを採用すべきだ。
業務ルールシナリオでは多くのモデルが良好なパフォーマンスを示したが、Doubao Proは2.25/4にとどまり、安全コンプライアンスでの3.9/4を下回った。これは同モデルがルール型制約へのプレッシャー耐性が最も弱いことを示しており、導入時には人手によるレビューノードの追加が必要だ。
戦略的判断
今回のデータは、Claude Sonnet 4.6の契約遵守能力がエンジニアリング標準とデータ境界では市場に過大評価されており、安全コンプライアンスでは過小評価されていることを示している。またQwen3-maxの業務ルール満点は、データ境界における極めて低い契約遵守生存率を覆い隠している可能性がある。次回テストで「データ境界+安全コンプライアンス」の複合問題が追加された場合、これらのモデルのS_recoverスコアの変化に特に注目する価値がある。
契約遵守はモデルの付加機能ではなく、本番導入前の必須要件である。
データ出典:YZ Index WDCD 契約遵守ランキング | Run #336 · シナリオマトリクス | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接