WDCD五大シナリオ横断評価:安全コンプライアンスの最低スコアは1.5点、Qwen3-maxの得意・不得意の差は2.5点
WDCD v3.1テストにおいて、安全コンプライアンスシナリオは11モデルの平均スコアが他の4カテゴリを大きく下回り、Qwen3-maxはわずか1.5/4点を記録。一方、claude-sonnet-4.6、gpt-o3、grok-4の3モデ
WDCD v3.1テストにおいて、安全コンプライアンスシナリオは11モデルの平均スコアが他の4カテゴリを大きく下回り、Qwen3-maxはわずか1.5/4点を記録。一方、claude-sonnet-4.6、gpt-o3、grok-4の3モデ
WDCD v3.1の5シナリオ横断評価において、安全コンプライアンスシナリオが最も低スコアとなり、Qwen3-Maxは2.13/4に留まる一方、Grok-4は3.86/4を記録し、両者の差は1.73点に達した。各モデルの得意・不得意シナリオ
WDCD v3.1の遵守テストにおいて、ビジネスルールシナリオが全シナリオ中で最も低い得点を記録し、grok-4が全シナリオで安定してトップを維持した。企業のモデル選定にあたっては、総合ランキングではなくシナリオ別のマッチングが重要であるこ
WDCD守約テストにおいて、安全コンプライアンスシナリオは全モデルで平均得点が最も低く、最高得点はdeepseek-v4-proの3.57/4にとどまった。企業のモデル選定においては、このシナリオへの個別加重評価が推奨される。
WDCDの三ラウンドテストにおいて、モデルはR1でほぼ全員高得点を記録するものの、R3で直接圧力をかけられると集団崩壊することが判明した。平均誠実率はわずか68.3%で、「約束」と「実行」の乖離が鮮明になった。
WDCDの三段階テストで、R1・R2でほぼ全モデルが高スコアを記録したにもかかわらず、R3で直接的なプレッシャーをかけると平均誠実率はわずか70.4%に低下し、66回が完全にゼロに崩壊したことが明らかになった。