WDCD守約ランキング:GLM-4.6が95.2点でトップ、Qwen3 Maxが65.6点で最下位
WDCD v3.1の守約テストにおいて、GLM-4.6が95.20点で最高スコアを記録した一方、Qwen3 Maxは65.60点で15モデル中最下位となり、両者の差は29.6点に達した。
WDCD v3.1の守約テストにおいて、GLM-4.6が95.20点で最高スコアを記録した一方、Qwen3 Maxは65.60点で15モデル中最下位となり、両者の差は29.6点に達した。
WDCD v3.1パイロットテストにおいて、Grok 4が91.76点で11モデル中首位を獲得。GLM-4.6は61.55点で最下位となり、首位との差は30.21点に達した。
8問のv2アンカー問題に基づく統計では、11の評価対象モデルのR1平均確認率が0.91に達した後、R2平均抵抗率は0.41まで低下し、R3平均誠実率はわずか45.5%にとどまった。R3での完全崩壊(0点)は計10回発生した。
WDCD v3.1守約テストにおいて、Grok 4が93.80点で首位、GLM-4.6が68.00点で最下位となり、両者の差は25.8点に達した。11モデルの評価結果には明確な断層が見られ、上位4モデルは83点超、下位3モデルは72点未満と
WDCD v3.1パイロット段階において、11モデルのR3平均誠実率は72.7%に留まり、110回のテスト中3回のR3完全崩壊(0点)が発生した。GLM-4.6、DeepSeek V4 Pro、Qwen3 Maxの3モデルが安全コンプライア
8問のv2アンカー問題を対象としたテストにおいて、11の評価対象モデル全てでR1確認率・R2抵抗率・R3誠実率がすべて0%となり、3段階の漸進的プレッシャー下で約束を守れたモデルは皆無だった。
WDCD v3.1守約テストにおいて、Grok 4が94.00点で第1位を獲得し、Doubao Proは68.17点で第11位に沈んだ。両モデルのR3施圧ラウンド得点はそれぞれ1.50/2と0.88/2であり、この差が総合スコアに直接25.
8問のv2アンカー問題に対する3ラウンドのテストで、11モデルのR3平均誠実率はわずか22.7%に留まり、7回の完全崩壊(0点)が発生した。初期確認率100%から大幅に低下したこの結果は、連続的な圧力下で大多数のモデルが制約を維持できないこ
WDCD v3.1の遵約テストにおいて、Grok 4が94.80点で首位を獲得し、Qwen3 Maxは69.20点で11位に留まり、両モデルの合計点差は25.6点に達した。R3高圧ラウンドでの耐性が最終順位を大きく左右する結果となった。
v2アンカーポイント問題8問のサンプリングにおいて、11モデルのR3完全崩壊が34/275回に達し、Doubao ProのR3崩壊率は32%に上る一方、Grok 4は崩壊ゼロを維持した。初回確認率が90%に達するモデルでも、第3ラウンドの圧
WDCD v3.1守約テストにおいて、Grok 4が94.80点で首位を獲得し、Doubao Proは64.20点で11位に終わり、両者の差は30.6点に達した。
WDCD v3.1守約ランキングでGPT-o3が94.00点で首位を獲得し、Qwen3 Maxが62.60点で最下位となった。評価対象の11モデルで首位と最下位の差は31.4点に達した。
WDCD v3.1テストにおいて、Grok 4が91.40点でトップに立ち、Qwen3 Maxが64.88点で最下位となった。上位4モデルと下位モデルの間には明確な格差が生じている。
8問のv2アンカー問題に対するworst-of-3サンプリングにおいて、11モデルのR3平均誠実率はわずか61.4%にとどまり、Claude Sonnet 4.6はR3崩壊率20%という最も深刻な衰退を示した。このデータは、現行主流モデルが