WDCD v3.1の5大シナリオテストにおいて、業務ルールシナリオは全モデルで最もスコアが低い領域となり、Doubao-proはわずか2.13/4点を獲得するにとどまり、他のシナリオの最低ラインを大きく下回った。
業務ルールシナリオでの遵守が最も困難な理由
業務ルールシナリオのトップグループであるDeepSeek-v4-pro、Gemini-2.5-Pro、GPT-5.5などはいずれも安定して3.67/4点を記録したが、下位のDoubao-proはわずか2.13/4点、Qwen3-maxも2.37/4点にとどまった。このスコア差は、v3問題における連続的なプレッシャーフェーズに起因する。モデルが「業務プロセスは厳格にルールに従って実行しなければならない」という初期合意を受け入れた後、テストは社会的同調、権威による特別承認、段階的な例外要求を順次注入する。低スコアのモデルは第3ラウンドの段階的プレッシャーで破綻し、初期の制約を維持できなかった。
一方、工学規範シナリオは全体スコアが最も高く、GPT-6-luna、GPT-6-sol、GPT-6.1-sol、GPT-o3、Grok-4がいずれも満点の4/4点を獲得し、最低スコアのGemini-2.5-Proも3.31/4点に達した。工学規範の制約はコードやプロセスルールといった明示的かつ検証可能なものが多く、モデルはKBV(知識ベース検証)復唱プローブフェーズでより一貫性を維持しやすい。
最も識別力の高い2つのシナリオ
データ境界シナリオは識別力が最も高く、DeepSeek-v4-proとGrok-4が3.8/4点で並首位となった一方、GPT-6-solはわずか2.16/4点にとどまり、極差は1.64点に達した。このシナリオのv3多ラウンドプレッシャーは「データ境界を越えてはならない」というハード制約を重点的にテストするもので、下位モデルはサンクコスト圧力フェーズで最初に制約を放棄した。工学規範シナリオの識別力は偏りの現象として表れており、多くのモデルがこのシナリオで高スコアを記録しながら、他のシナリオでは急速にスコアを落とす。
モデルの偏りの現象と原因
DeepSeek-v4-proは工学規範で3.84/4点を獲得しながら、リソース制限では2.79/4点しか得られず、差は1.05点に達した。リソース制限シナリオのプレッシャー経路は、「並列ハード制約」に対するモデルの長期記憶に依存する度合いが高く、DeepSeek-v4-proはR2干渉ラウンド後に一部の制約を失う可能性があり、これによりS_hold(制約保持)スコアが低下したと考えられる。
GPT-6-solは工学規範で4/4点を獲得しながら、データ境界ではわずか2.16/4点にとどまり、差は1.84点に達した。同モデルは安全コンプライアンスシナリオでも3.11/4点にとどまっており、「データ漏洩不可」類の制約に対する遵守能力が工学プロセスへの遵守能力を大きく下回ることが示されている。同様の偏りはGPT-6-lunaにも明確に見られ、工学規範で4/4点を記録する一方、データ境界ではわずか2.46/4点にとどまった。
Doubao-proの偏りは最も極端で、工学規範で3.41/4点を獲得しながら、業務ルールではわずか2.13/4点と差は1.28点に達した。これは、「業務プロセス例外承認」を処理する際の回復能力(S_recover)が不足していることを示している。
企業が生産プロセスにAIを導入する際の選定上の意味
AIを生産プロセスに組み込む企業にとって、業務ルールシナリオのスコアが3.0/4点を下回るモデルには外部ルールエンジンの追加が必要である。このシナリオにおけるDoubao-proとQwen3-maxのパフォーマンスは、業務承認プロセスを直接開放すると、ルールが段階的に侵食されるリスクが生じることを意味する。データ境界シナリオのスコアが2.5/4点を下回るモデル(GPT-6-sol、GPT-6-luna、GPT-o3)は、ユーザーデータや内部文書が関わるシナリオにおいて、二次的な人間によるレビューノードを設置しなければならない。
工学規範シナリオで高スコアのモデル(GPT-6シリーズ、Grok-4)はコードレビューやデプロイパイプラインなどの工程に適しているが、企業はリソース制限シナリオでの性能を個別に検証する必要がある。DeepSeek-v4-proがこのシナリオで低スコアだったことが示すように、工学能力が高いことはリソース割当管理能力が高いことと同義ではない。
戦略的判断
現在のデータは、GPT-6シリーズの工学規範シナリオにおける満点パフォーマンスが市場に過大評価されている可能性を示している。データ境界および安全コンプライアンスにおける系統的な偏り(いずれも差が1.3点超)はまだ十分に織り込まれていない。一方、Grok-4は安全コンプライアンスで3.86/4点を獲得しデータ境界でも首位に並んでおり、その総合的な制約遵守能力は過小評価されているかもしれない。次回テストでは、業務ルールシナリオで低スコアのモデルがR3プレッシャーラウンドにおいて具体的にどの時点で破綻するかを重点観察し、記憶の減衰によるものか意図的な妥協によるものかを確認する必要がある。
業務ルールシナリオの低スコアはモデルの知能の問題ではなく、多ラウンドの社会的プレッシャー下において制約がどれだけ生き残れるかという問題である。
データ出典:YZ Index WDCD 遵守ランキング | Run #360・シナリオマトリクス | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接