7モデルのWDCD守約スコアが集団下落、Claude Sonnet 4.6のみ8.6点逆上昇
WDCD v3.1テストにおいて、Claude Sonnet 4.6が前回比8.6点上昇した一方、7モデルが一斉に下落し、GLM-4.6は27点、Gemini 2.5 Proは23.8点の大幅下落を記録した。
WDCD v3.1テストにおいて、Claude Sonnet 4.6が前回比8.6点上昇した一方、7モデルが一斉に下落し、GLM-4.6は27点、Gemini 2.5 Proは23.8点の大幅下落を記録した。
WDCD v3.1の5大制約テストにおいて、安全コンプライアンス場面が最も守約が困難な領域であることが判明した。gemini-2.5-proはわずか0.8/4点にとどまった一方、grok-4は4/4満点を獲得し、同一場面内の最大格差は3.2
8問のv2アンカー問題に基づく統計では、11の評価対象モデルのR1平均確認率が0.91に達した後、R2平均抵抗率は0.41まで低下し、R3平均誠実率はわずか45.5%にとどまった。R3での完全崩壊(0点)は計10回発生した。
WDCD v3.1守約テストにおいて、Grok 4が93.80点で首位、GLM-4.6が68.00点で最下位となり、両者の差は25.8点に達した。11モデルの評価結果には明確な断層が見られ、上位4モデルは83点超、下位3モデルは72点未満と
WDCD v3.1(Run #311)において、Claude Sonnet 4.6のスコアが前回比5点下落する一方、Doubao Proは7.5点上昇し、両者の逆方向の変動が今期唯一の顕著な変化となった。その他のモデルは概ね安定を維持してい
WDCD v3.1の約束遵守テストにおける5大制約シナリオ・11モデルの横断評価では、安全コンプライアンスシナリオが全体で最低スコアの次元となり、Qwen3-maxはわずか2.19/4にとどまった。一方、glm-4.6は複数シナリオで首位を
11のAIモデルを対象にWDCD(Will Do, Can Do)評価の8問v2アンカー問題でサンプリングを実施した結果、R1確認率は全モデル100%だったが、R3誠実率は平均49.5%にとどまり、29/319回の完全崩壊が確認された。二ラ
WDCD v3.1テストでGrok 4が93.21点で11モデル中1位を獲得。Qwen3 Maxは74.31点で最下位となり、両者の差は18.9点に達した。
WDCD v3.1パイロットデータにおいて、Gemini 2.5 Proが22.2点の大幅上昇で最大の勝者となり、Gemini 3.1 Proが97.70点で首位を獲得した。一方、Claude Sonnet 4.6は唯一13点の下落を記録し
WDCD v3.1パイロットデータによると、安全コンプライアンスシナリオにおける11モデルの平均スコアが最も低く、Qwen3-Maxはわずか2/4点、DeepSeek V4 Proは2.5/4点にとどまり、全シナリオ中で最も約束遵守が困難な
WDCD v3.1パイロット段階において、11モデルのR3平均誠実率は72.7%に留まり、110回のテスト中3回のR3完全崩壊(0点)が発生した。GLM-4.6、DeepSeek V4 Pro、Qwen3 Maxの3モデルが安全コンプライア
WDCD v3.1の約束遵守テストにおいて、Gemini 3.1 Proが97.70点で11モデル中首位を獲得し、Qwen3 Maxが70.30点で最下位となった。両者の差は27.4点に達した。
WDCD v3.1テスト(Run #296)において、Claude Sonnet 4.6が13.5点上昇して91.60点を記録した一方、Gemini 2.5 Proは12.5点急落。Grok 4が96.30点で首位を維持し、GPT-o3が9
WDCD v3.1テストにおいて、安全コンプライアンスシナリオは11モデルの平均スコアが他の4カテゴリを大きく下回り、Qwen3-maxはわずか1.5/4点を記録。一方、claude-sonnet-4.6、gpt-o3、grok-4の3モデ
8問のv2アンカー問題を対象としたテストにおいて、11の評価対象モデル全てでR1確認率・R2抵抗率・R3誠実率がすべて0%となり、3段階の漸進的プレッシャー下で約束を守れたモデルは皆無だった。
WDCD v3.1守約(約束遵守)総合ランキングにおいて、Grok 4が96.30点で首位を獲得し、Doubao Proの67.90点と28.4点の大差をつけた。上位3モデルと下位3モデルの平均点差は約25点に達し、モデル間の能力格差が鮮明
WDCD v3.1パイロット評価において、Doubao Pro・Gemini 2.5 Pro・GLM-4.6・Qwen3 Maxの4モデルがそれぞれ6点以上のスコア上昇を記録し、下落したモデルはゼロ。Grok 4は94.00点で首位を堅持し
WDCD v3.1の5大制約シナリオ横断評価では、業務ルールシナリオで全体スコアが最低となり、Doubao-Proはわずか1.83/4と、Grok-4の満点4/4を大幅に下回った。安全コンプライアンスシナリオでも1.87/4という極めて低い
8問のv2アンカー問題を対象とした評価において、11モデルのR3平均誠実率はわずか51.3%にとどまり、26回の完全崩壊(0点)が第3ラウンドの加圧後における制約遵守の系統的な劣化を如実に示した。
WDCD v3.1守約テストにおいて、Grok 4が94.00点で第1位を獲得し、Doubao Proは68.17点で第11位に沈んだ。両モデルのR3施圧ラウンド得点はそれぞれ1.50/2と0.88/2であり、この差が総合スコアに直接25.