業務ルール1.83点が最低、Grok-4の安全コンプライアンス3.86点——5大シナリオで最も約束を守れないのはどのモデルか
WDCD v3.1の5大制約シナリオ横断評価では、業務ルールシナリオで全体スコアが最低となり、Doubao-Proはわずか1.83/4と、Grok-4の満点4/4を大幅に下回った。安全コンプライアンスシナリオでも1.87/4という極めて低い
WDCD v3.1の5大制約シナリオ横断評価では、業務ルールシナリオで全体スコアが最低となり、Doubao-Proはわずか1.83/4と、Grok-4の満点4/4を大幅に下回った。安全コンプライアンスシナリオでも1.87/4という極めて低い
WDCD v3.1の5大シナリオクロス評価において、安全コンプライアンスシナリオが全モデルの守約能力の最大の弱点となり、Qwen3-maxが最下位の1.15/4点、GPT-5.5がトップの4/4点を記録し、最大スコア差は2.85点に達した。
WDCDの5シナリオ横断評価で、業務ルールが全モデル共通の弱点となり平均2.05点に留まる一方、安全コンプライアンスシナリオでは最高3.5点と最低1.5点の差が2点と最大の差別化を示した。
DoubaoProの最新YZ Index評価で安定性スコアが54.5から34.7へと19.8ポイント急落。同じ質問に対する回答の一貫性欠如が深刻な問題として浮上。
Claude 4.6のプログラミング能力が38.3ポイント向上した一方で、安定性が54.2から31.2へと壊滅的に低下し、アルゴリズムレベルでのシステム崩壊が発生した。
Anthropicの Claude AIが3月2日と3日に連続して大規模な障害を起こし、前例のない需要増加によりインフラのボトルネックが露呈した。