安全コンプライアンス場面の最低スコアはわずか0.8点――5大制約でモデルの守約能力を原形に戻したのは何か
WDCD v3.1の5大制約テストにおいて、安全コンプライアンス場面が最も守約が困難な領域であることが判明した。gemini-2.5-proはわずか0.8/4点にとどまった一方、grok-4は4/4満点を獲得し、同一場面内の最大格差は3.2
WDCD v3.1の5大制約テストにおいて、安全コンプライアンス場面が最も守約が困難な領域であることが判明した。gemini-2.5-proはわずか0.8/4点にとどまった一方、grok-4は4/4満点を獲得し、同一場面内の最大格差は3.2
WDCD v3.1の約束遵守テストにおける5大制約シナリオ・11モデルの横断評価では、安全コンプライアンスシナリオが全体で最低スコアの次元となり、Qwen3-maxはわずか2.19/4にとどまった。一方、glm-4.6は複数シナリオで首位を
WDCD v3.1の5大場景横断評価において、ビジネスルール場景が全モデル中最低スコアの赛道となり、Qwen3-maxはわずか1.55/4点にとどまった。一方、Claude opus 4.7はデータ境界で4/4の満点を獲得しながらも、リソー
WDCD v3.1の5シナリオ横断評価において、データ境界シナリオの全体スコアが最も低く、11モデルの平均はわずか約2.8点であった。Doubao-proは1.4/4点で唯一2点を下回り、gpt-o3とgrok-4が3.6/4点で並んだ。
WDCD v3.1の契約遵守テストにおいて、安全コンプライアンスシーンで最大2.2点の差が生じ、GPT-5.5とQwen3-Maxが最低の1.8/4点を記録した一方、エンジニアリング規範シーンでは全11モデルが3.2〜4点に集中した。
WDCD v3.1のパイロットデータにより、業務ルールシナリオが11モデル中で約束遵守生存率が最も低い次元であることが判明した。首位のDeepSeek V4 Proが4/4満点を獲得する一方、最下位のQwen3-maxはわずか1.55/4に
WDCD v3.1パイロット評価において、業務ルールシナリオが全シナリオ中最低得点となり、最下位のqwen3-maxはわずか1.3/4を記録した。また、doubao-proをはじめとする複数モデルでシナリオ間の得点差が最大2.1点に達する「
WDCD遵守テストにおいて、リソース制限のシナリオが全モデルを苦戦させ、11モデルの平均得点はわずか1.7点と、他4シナリオを大きく下回った。本記事では各モデルの偏向特性と企業選定への具体的提言を分析する。
WDCD守約テストでは11モデルがリソース制限シーンで軒並み低スコアを記録し、平均1.95点に留まった。安全コンプライアンスシーンでは最大の差が現れ、企業選定における偏科モデルのリスクが浮き彫りとなった。
WDCDのパイロットデータが公開され、30問・11モデル・5大シナリオのクロスマトリクスから反直感的な結論が導き出された。すべてのシナリオで約束を守れたモデルは1つもなく、最も単純に見える「リソース制限」シナリオで全員が撃沈し、首位のgro