Gemini 2.5 ProのWDCDスコアが22.2点急上昇、Claude Sonnet 4.6のみ13点下落
WDCD v3.1パイロットデータにおいて、Gemini 2.5 Proが22.2点の大幅上昇で最大の勝者となり、Gemini 3.1 Proが97.70点で首位を獲得した。一方、Claude Sonnet 4.6は唯一13点の下落を記録し
WDCD v3.1パイロットデータにおいて、Gemini 2.5 Proが22.2点の大幅上昇で最大の勝者となり、Gemini 3.1 Proが97.70点で首位を獲得した。一方、Claude Sonnet 4.6は唯一13点の下落を記録し
WDCD v3.1パイロット評価において、Doubao Pro・Gemini 2.5 Pro・GLM-4.6・Qwen3 Maxの4モデルがそれぞれ6点以上のスコア上昇を記録し、下落したモデルはゼロ。Grok 4は94.00点で首位を堅持し
WDCD v3.1パイロットデータでは、Gemini 2.5 Pro、GPT-5.5、Claude Opus 4.7、GPT-o3の4モデルが上昇し、Doubao Proのみが7.3点下落するという「4上昇・1下落」の構図が明確となった。
v2アンカーポイント問題8問のサンプリングにおいて、11モデルのR3完全崩壊が34/275回に達し、Doubao ProのR3崩壊率は32%に上る一方、Grok 4は崩壊ゼロを維持した。初回確認率が90%に達するモデルでも、第3ラウンドの圧
WDCD v3.1パイロットテストにおいて、11のAIモデルを対象に三段階のアンカーポイント評価を実施した結果、R1平均確認率0.99に対しR3平均誠実率は50.7%にとどまり、28回のゼロ点事例が発生した。この結果は、モデルが「約束を立て