AIに無意味なルール違反を誘導しようとしたが、すべて失敗に終わった
4つの実際には無意味なルールを設定し、7ラウンドの対話でAIモデルにルール違反を誘導しようとしたが、いずれのモデルも一切違反しなかった。新たな行動ベースの評価システム「WDCD v4」の導入により、コードの実際の実行結果でコンプライアンスを
4つの実際には無意味なルールを設定し、7ラウンドの対話でAIモデルにルール違反を誘導しようとしたが、いずれのモデルも一切違反しなかった。新たな行動ベースの評価システム「WDCD v4」の導入により、コードの実際の実行結果でコンプライアンスを
WDCD v3.1パイロットデータでは、Gemini 2.5 Pro、GPT-5.5、Claude Opus 4.7、GPT-o3の4モデルが上昇し、Doubao Proのみが7.3点下落するという「4上昇・1下落」の構図が明確となった。
WDCD v3.1の5大シナリオクロス評価において、安全コンプライアンスシナリオが全モデルの守約能力の最大の弱点となり、Qwen3-maxが最下位の1.15/4点、GPT-5.5がトップの4/4点を記録し、最大スコア差は2.85点に達した。
8問のv2アンカー問題に対する3ラウンドのテストで、11モデルのR3平均誠実率はわずか22.7%に留まり、7回の完全崩壊(0点)が発生した。初期確認率100%から大幅に低下したこの結果は、連続的な圧力下で大多数のモデルが制約を維持できないこ
WDCD v3.1守約テストにおいて、Grok 4が97.50点で首位を獲得し、Qwen3 Maxは69.50点で11位(最下位)となった。両モデルの合計スコア差は28点に達する。
WDCD v3.1テストにおいて、Doubao ProとGLM-4.6が大幅上昇した一方、GPT-o3とDeepSeek V4 Proが顕著に下落し、AIモデルの約束遵守能力ランキングが大きく変動した。現在のトップ5はGrok 4を筆頭に、
WDCD v3.1の5大場景横断評価において、ビジネスルール場景が全モデル中最低スコアの赛道となり、Qwen3-maxはわずか1.55/4点にとどまった。一方、Claude opus 4.7はデータ境界で4/4の満点を獲得しながらも、リソー
WDCD v3.1パイロットテストにおいて、11モデルがv2アンカー問題8問で明確な三ラウンド衰退を示した。R1確認率100%、R2抵抗率86%に対し、R3誠実率はわずか59.1%にとどまり、GPT-o3は20%という突出した崩壊率を記録し
WDCD v3.1の遵約テストにおいて、Grok 4が94.80点で首位を獲得し、Qwen3 Maxは69.20点で11位に留まり、両モデルの合計点差は25.6点に達した。R3高圧ラウンドでの耐性が最終順位を大きく左右する結果となった。
WDCD v3.1の最新評価(Run #271)において、Claude Sonnet 4.6が83.72点を記録して8.8ポイント上昇、Doubao Proは16ポイント下落した。11モデル中、上昇は2モデル、下落は1モデルにとどまり、首位
WDCD v3.1の5シナリオ横断評価において、データ境界シナリオの全体スコアが最も低く、11モデルの平均はわずか約2.8点であった。Doubao-proは1.4/4点で唯一2点を下回り、gpt-o3とgrok-4が3.6/4点で並んだ。
v2アンカーポイント問題8問のサンプリングにおいて、11モデルのR3完全崩壊が34/275回に達し、Doubao ProのR3崩壊率は32%に上る一方、Grok 4は崩壊ゼロを維持した。初回確認率が90%に達するモデルでも、第3ラウンドの圧
WDCD v3.1守約テストにおいて、Grok 4が91.04点で首位を獲得し、Doubao Proは58.00点で最下位となった。11モデルが25問に挑んだworst-of-3サンプリングの結果、上位と下位の差は33.04点に達した。
WDCD v3.1テストにおいて、GPT-o3が9.5ポイント上昇してトップ2入りを果たした一方、GLM-4.6が14.9ポイント、Claude Sonnet 4.6が10.8ポイント下落するなど、AIモデル間で大きな順位変動が生じた。
WDCD v3.1の契約遵守テストにおいて、安全コンプライアンスシーンで最大2.2点の差が生じ、GPT-5.5とQwen3-Maxが最低の1.8/4点を記録した一方、エンジニアリング規範シーンでは全11モデルが3.2〜4点に集中した。
11モデルを対象にした3ラウンド連続施圧テストで、初期確認率R1は0.91だったものの、R3誠実率は54.5%まで低下し、約束遵守能力の系統的な減衰が明らかになった。Doubao ProはR1から崩壊した一方、DeepSeek V4 Pro
WDCD v3.1守約テストにおいて、Grok 4が97.50点で首位を獲得し、Doubao Proが68.00点で最下位となった。上位と下位の差は29.5点に達した。
WDCD v3.1守約テストのRun #253において、Claude Opus 4.7が6.8点上昇、Claude Sonnet 4.6が6.7点上昇した一方、Gemini 3.1 Proが5.6点下落し、多段階の段階的圧力下でのモデル間の
WDCD v3.1の5大シナリオ横断評価において、ビジネスルールシナリオが全モデルにとって最難関となり、エンジニアリング規範シナリオでは最大3点という大きなスコア差が生じた。Claude-opus-4.7はエンジニアリング規範のみ3/4にと
8問のv2アンカー問題を用いた3ラウンドテストにおいて、11モデルの平均R1確認率は0.95、R2抵抗率は0.86だったが、R3誠実率は45.5%まで低下し、9回の完全崩壊(0点)が発生した。この結果は、持続的なプレッシャー下でのモデルの約