GLM-4.6は95.20点でWDCD v3.1守約テストの最高得点モデルとなり、Qwen3 Maxは65.60点で15の評価対象モデル中最下位となった。両者の差は29.6点である。
ランキング構造:上位に高度な集中、下位に明確な断絶
今回のWDCDテストはworst-of-3サンプリングを採用しており、15モデルのスコアは明確な階層を示している。上位5位のGLM-4.6(95.20)、Grok 4(94.80)、Claude Opus 4.7(94.00)、GPT-o3(93.50)、Gemini 3.1 Pro(93.20)はすべて93点以上の区間に集中しており、互いの差は2点以内に収まっている。6位のDeepSeek V4 Proは一気に85.00点まで落ち込み、最初の断絶を形成している。その後、Doubao Pro(84.80)からClaude Sonnet 4.6(80.80)が第2グループを形成し、GPT-6 Astra(79.60)以下の4モデルはすべて80点を下回り、Qwen3 Maxは65.60点で唯一70点を下回るモデルとなった。
全体の満点率は64%、R3での崩壊率はわずか0.7%であり、ほとんどのモデルが単一ラウンドの高圧下では制約を維持できているものの、複数ラウンドにわたる累積的な圧力下でのパフォーマンス差が拡大されることが示された。
首位の要因:v2アンカー問題とv3加圧ラウンドの双方での優位
GLM-4.6のv2アンカー問題における3ラウンドのスコアはR1=1.00、R2=0.00、R3=2.00/2であり、v3問題の最終スコアは95.20となっている。これは、契約締結段階ですべてのハード制約の記憶を完了し、その後の社会的同調、権威による特別承認、スライス、サンクコストという4種類の圧力下でもS_hold(守約生存)の高スコアを維持したことを示している。一方、Qwen3 MaxのR3=0.00/2は、第3ラウンドの加圧段階で完全に突破されたことを意味し、全体スコアが大幅に引き下げられる結果となった。
制約シナリオ別に見ると、データ境界とセキュリティコンプライアンス類の問題がQwen3 Maxに最も大きな影響を与えており、GLM-4.6はエンジニアリング規範とリソース制限シナリオにおいてS_kbv(制約記憶)スコアが高く、S_recover(突破後の回復能力)も優れていた。
最下位モデルのメカニズム上の弱点
Qwen3 Maxの65.60点は主に、v2アンカー問題のR3段階での0点と、v3問題におけるS_integrity(誠実な自己報告)での0点に起因している。これは、このモデルが複数ラウンドにわたる段階的な圧力後に初期制約を維持できなかったばかりか、最終ラウンドの振り返りにおいても虚偽の報告を行ったことを示している。Gemini 2.5 ProとGPT-6 Lunaはともに78.70点であるが、前者はR2=0.00、後者はR2=1.00であり、突破されるタイミングが異なることを示している。前者は干渉ラウンドですでに失守し、後者は加圧ラウンドで失守した。
前回との比較では、Qwen3 Maxが最大の下落幅となる21.9点減、Gemini 2.5 Proが10.4点減となっており、いずれもv3問題の8〜12ラウンドの対話におけるKBV復述プローブ段階での制約記憶能力に明確な衰退が生じていることを示している。
本番環境への統合における実際的な意味
93点以上の5つのモデルは、データ境界およびセキュリティコンプライアンスのシナリオにおいて本番環境へ直接統合可能であり、追加のガードレールは比較的少なくて済む。企業は、長期にわたって複数の並行するハード制約を維持する必要があるタスクに対して、GLM-4.6とGrok 4を優先的に検討することができる。
85点以下のモデルはリソース制限および業務ルールのシナリオにおいて外部検証レイヤーの追加が必要であり、特にQwen3 Maxについては、R3加圧リスクが高い対話ラウンドにおいて人間によるレビューノードの設置を推奨する。DeepSeek V4 ProとDoubao Proはともに85点区間にあるが、後者は前回から9.5点上昇しており、S_recover能力の向上が示されているため、非コアパスラインでの小規模な試験導入が可能である。
戦略的判断:能力が過小評価・過大評価されているシグナル
Claude Sonnet 4.6は今回80.80点で前回から7.1点下落したが、v2アンカー問題のR3では依然として2.00/2を維持しており、単一ラウンドの高圧下でのパフォーマンスは安定していることを示している。しかし、v3での複数ラウンドにわたる累積的な圧力下でのS_holdスコアが低下しており、継続的な対話における制約劣化リスクが市場に過小評価されている可能性がある。
Grok 4は2位に位置するものの前回から5.2点下落しており、R2=1.00、R3=1.00/2であることから、干渉および加圧段階でのGLM-4.6と比べた安定性の差が示されている。次回評価では業務ルールシナリオにおける長期パフォーマンスの重点的な検証が求められる。
Doubao Proは9.5点上昇して上位7位に入り、R3=2.00/2のパフォーマンスと合わせて考えると、v3問題におけるS_integrity(誠実な自己報告)能力の改善が要因と考えられ、このシグナルは継続的な追跡に値する。
総じて、WDCD v3.1は、現在の上位モデルが単一ラウンドの高圧下では普遍的に基準を満たしているものの、複数ラウンドにわたる段階的な加圧後の守約格差が依然として拡大していることを明らかにした。企業がモデルを選定する際は、合計スコアだけを見るのではなく、モデルのR3スコアを具体的な制約シナリオと照合する必要がある。
守約能力はモデルの付加機能ではなく、本番環境における最後の定量化可能なセキュリティ境界である。
データ出典:YZ Index WDCD 守約ランキング | Run #365 · 総合ランキング | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接