業務ルール1.83点が最低、Grok-4の安全コンプライアンス3.86点——5大シナリオで最も約束を守れないのはどのモデルか
WDCD v3.1の5大制約シナリオ横断評価では、業務ルールシナリオで全体スコアが最低となり、Doubao-Proはわずか1.83/4と、Grok-4の満点4/4を大幅に下回った。安全コンプライアンスシナリオでも1.87/4という極めて低い
WDCD v3.1の5大制約シナリオ横断評価では、業務ルールシナリオで全体スコアが最低となり、Doubao-Proはわずか1.83/4と、Grok-4の満点4/4を大幅に下回った。安全コンプライアンスシナリオでも1.87/4という極めて低い
WDCD v3.1の5大シナリオ横断評価において、ビジネスルールシナリオが全モデルにとって最難関となり、エンジニアリング規範シナリオでは最大3点という大きなスコア差が生じた。Claude-opus-4.7はエンジニアリング規範のみ3/4にと
WDCD守約テストにおいて、安全コンプライアンスシナリオは全モデルで平均得点が最も低く、最高得点はdeepseek-v4-proの3.57/4にとどまった。企業のモデル選定においては、このシナリオへの個別加重評価が推奨される。
WDCD遵守テストの試験運用データによると、業務ルールシナリオは全モデル共通の弱点となり最高得点はわずか2.5点、一方で安全コンプライアンスシナリオはモデル間の格差を最大に広げる結果となりました。
YZ IndexのWDCD(Winzheng Dynamic Contextual Decay)遵守テストにおいて、11の主流AIモデルを五大シーンで深層的に横断評価した。リソース制限シーンが全体で最低スコア(平均1.86点)、安全コンプラ
WDCDのパイロットデータが公開され、30問・11モデル・5大シナリオのクロスマトリクスから反直感的な結論が導き出された。すべてのシナリオで約束を守れたモデルは1つもなく、最も単純に見える「リソース制限」シナリオで全員が撃沈し、首位のgro