R3誠実率わずか50.7%:11モデル・三段階アンカーポイントにおける約束崩壊の真相
WDCD v3.1パイロットテストにおいて、11のAIモデルを対象に三段階のアンカーポイント評価を実施した結果、R1平均確認率0.99に対しR3平均誠実率は50.7%にとどまり、28回のゼロ点事例が発生した。この結果は、モデルが「約束を立て
WDCD v3.1パイロットテストにおいて、11のAIモデルを対象に三段階のアンカーポイント評価を実施した結果、R1平均確認率0.99に対しR3平均誠実率は50.7%にとどまり、28回のゼロ点事例が発生した。この結果は、モデルが「約束を立て
WDCDテストにおいて、Grok 4はR3フェーズで誠実率1.83/2を維持しつつ崩壊ゼロを達成した一方、Claude Sonnet 4.6とGPT-o3はいずれも6回のR3完全崩壊(17.1%)を記録した。3ラウンドにわたる圧力テストが各
WDCDテストにおいて、Claude Opus 4.7のR3誠実率はわずか0.34/2であるのに対し、Grok 4は1.22/2に達し、両者のR3スコア差は0.88点に上り、継続的なプレッシャー下での異なるモデルの約束遵守能力の差が浮き彫り
WDCD三段階テストの結果、モデルは初期段階でほぼ全員が高得点を獲得したものの、二度の干渉を経た後、6割以上のモデルが直接的な圧力下で当初の約束を完全に放棄した。