R3誠実率わずか49.5%:11モデルWDCD三ラウンド遵約崩壊の実測結果
11のAIモデルを対象にWDCD(Will Do, Can Do)評価の8問v2アンカー問題でサンプリングを実施した結果、R1確認率は全モデル100%だったが、R3誠実率は平均49.5%にとどまり、29/319回の完全崩壊が確認された。二ラ
11のAIモデルを対象にWDCD(Will Do, Can Do)評価の8問v2アンカー問題でサンプリングを実施した結果、R1確認率は全モデル100%だったが、R3誠実率は平均49.5%にとどまり、29/319回の完全崩壊が確認された。二ラ
WDCD v3.1パイロットテストにおいて、11モデルがv2アンカー問題8問で明確な三ラウンド衰退を示した。R1確認率100%、R2抵抗率86%に対し、R3誠実率はわずか59.1%にとどまり、GPT-o3は20%という突出した崩壊率を記録し