WDCD五大シナリオ横断評価:安全コンプライアンスの最低スコアは1.5点、Qwen3-maxの得意・不得意の差は2.5点
WDCD v3.1テストにおいて、安全コンプライアンスシナリオは11モデルの平均スコアが他の4カテゴリを大きく下回り、Qwen3-maxはわずか1.5/4点を記録。一方、claude-sonnet-4.6、gpt-o3、grok-4の3モデ
WDCD v3.1テストにおいて、安全コンプライアンスシナリオは11モデルの平均スコアが他の4カテゴリを大きく下回り、Qwen3-maxはわずか1.5/4点を記録。一方、claude-sonnet-4.6、gpt-o3、grok-4の3モデ
WDCD v3.1の5大制約シナリオ横断評価では、業務ルールシナリオで全体スコアが最低となり、Doubao-Proはわずか1.83/4と、Grok-4の満点4/4を大幅に下回った。安全コンプライアンスシナリオでも1.87/4という極めて低い
WDCD v3.1パイロットテストにおいて、11モデルがv2アンカー問題8問で明確な三ラウンド衰退を示した。R1確認率100%、R2抵抗率86%に対し、R3誠実率はわずか59.1%にとどまり、GPT-o3は20%という突出した崩壊率を記録し
WDCD v3.1の5大シナリオ横断評価において、ビジネスルールシナリオが全モデルにとって最難関となり、エンジニアリング規範シナリオでは最大3点という大きなスコア差が生じた。Claude-opus-4.7はエンジニアリング規範のみ3/4にと
WDCD v3.1の5シナリオ横断評価において、安全コンプライアンスシナリオが最も低スコアとなり、Qwen3-Maxは2.13/4に留まる一方、Grok-4は3.86/4を記録し、両者の差は1.73点に達した。各モデルの得意・不得意シナリオ
WDCD v3.1パイロットテストにおいて、11のAIモデルを対象に三段階のアンカーポイント評価を実施した結果、R1平均確認率0.99に対しR3平均誠実率は50.7%にとどまり、28回のゼロ点事例が発生した。この結果は、モデルが「約束を立て
WDCD守約テストにおいて、安全コンプライアンスシナリオは全モデルで平均得点が最も低く、最高得点はdeepseek-v4-proの3.57/4にとどまった。企業のモデル選定においては、このシナリオへの個別加重評価が推奨される。
WDCDパイロットデータによると、リソース制限シナリオでは全モデルの得点が最も低く、首位のgemini-3.1-proでもわずか2.5点にとどまった。一方、業務ルールシナリオでは最大の格差が生じ、gemini-2.5-proとgpt-o3が
WDCDの5シナリオ横断評価で、業務ルールが全モデル共通の弱点となり平均2.05点に留まる一方、安全コンプライアンスシナリオでは最高3.5点と最低1.5点の差が2点と最大の差別化を示した。