WDCD v3.1の約束遵守テストにおいて、Gemini 3.1 Proが97.70点で評価対象11モデルの首位を獲得し、Qwen3 Maxが70.30点で最下位となった。両者の差は27.4点に達する。サンプリングはworst-of-3方式を採用し、問題プールはv3マルチターン漸進加圧問題17問とv2アンカー問題8問で構成される。採点はS_hold 60点・S_kbv 15点・S_recover 10点・S_integrity 15点の4サブスコアに基づき厳格に実施された。
順位の構図:上位集中、下位に断層
上位5モデルのWDCDスコアはいずれも94.7点以上で、Gemini 3.1 Pro 97.70点、Grok 4 96.30点、GLM-4.6 95.00点、GPT-o3 94.80点、Claude Opus 4.7 94.70点となった。6位のGemini 2.5 Pro 93.20点と7位のGPT-5.5 92.60点は依然として90点以上を維持している。8位のDeepSeek V4 Pro 88.60点から下落が始まり、9位のDoubao Pro 79.10点、10位のClaude Sonnet 4.6 78.60点、11位のQwen3 Max 70.30点と明確な断層が形成されている。
全体統計では満点率68.2%、R3崩壊率はわずか2.7%となった。これは多くのモデルがv2アンカー問題のR1・R2段階では制約を維持できるものの、R3加圧段階で差が拡大することを示している。GLM-4.6のR3は0.00/2、GPT-o3のR2は0.00、DeepSeek V4 ProのR2・R3はともに0.00、Qwen3 MaxのR3は0.00であり、下位モデルが連続加圧下でS_holdスコアが著しく低下することが示されている。
首位分析:Gemini 3.1 Proの制約記憶と回復メカニズム
Gemini 3.1 Proはv2アンカー問題においてR1=1.00、R2=1.00、R3=2.00/2と全問満点を獲得し、v3問題のS_kbvおよびS_recoverでも高得点を記録した。これはデータ境界やセキュリティコンプライアンスのシナリオにおいて、社会的同調や埋没コストによる加圧への耐性が比較的高いことを示唆している。その要因として、複数の並行ハード制約に対するKBV復唱プローブへの応答がより安定しており、最終ラウンドの誠実な自己申告スコアが高いことが考えられる。
プロセス運用を行う企業にとって、このモデルはリソース制約やエンジニアリング規範のシナリオに直接導入可能であり、制約突破後の回復能力も高く、追加のガードレールを必要としない。ただしビジネスルールのシナリオでは引き続き人的レビューの保持を推奨する。S_integrity 15点の仕組み上、いかなる虚偽申告も直ちに0点となるためである。
最下位分析:Qwen3 MaxのR3崩壊とS_hold損失
Qwen3 MaxのWDCDスコアは70.30点で、v2アンカー問題はR1=1.00、R2=1.00、R3=0.00/2となり、R3での満点損失が合計スコアの大幅な後退に直結した。v3問題のworst-of-3サンプリングと合わせると、連続加圧ラウンドにおけるS_hold 60点部分の損失が最も大きく、権威的な特例承認や段階的加圧の下で制約記憶の減衰がより速いと推測される。
モデル選定上の意味は明確である。セキュリティコンプライアンスやデータ境界のシナリオでは、このモデルを本番プロセスに直接導入すべきではなく、追加の出力フィルタリングガードレールが必要となる。マルチターン対話に入った場合、制約突破後の回復確率が低く、S_recoverスコアによる補填が困難なためである。
上位層と下位層の差を生むメカニズムの違い
上位モデル(上位5位)のR3段階平均スコアは1.6/2以上であるのに対し、下位モデル(下位3位)の平均スコアは0.67/2となった。差はv3問題の連続加圧段階とv2アンカー問題のR3加圧段階に集中している。GLM-4.6とQwen3 MaxのR3が0点となったことは、埋没コストによる圧力増大の下でS_holdの持続時間が短いことを示している。
戦略的判断として、Claude Opus 4.7は今回94.70点かつR3満点を獲得しており、約束遵守能力が市場で過小評価されている可能性がある。Claude Sonnet 4.6の78.60点は同シリーズとの差が13点あり、R2・R3のパフォーマンスが不安定であるため、次回の検証が注目される。DeepSeek V4 ProはR2・R3がともに0点であり、エンジニアリング規範シナリオへの導入リスクが比較的高い。
前回との比較データが支持する判断として、Gemini 2.5 Proが22.2点上昇、Doubao Proが11.2点上昇しており、v3問題のS_recoverおよびS_integrityスコアの改善が見られる。Claude Sonnet 4.6は13.0点下降しており、R2段階の制約記憶に問題が生じた可能性がある。
企業のモデル選定において、90点以上のモデルはセキュリティコンプライアンスやデータ境界シナリオへの直接導入に適しており、80〜90点のモデルはリソース制約シナリオにおいてガードレールの追加が必要で、70点未満のモデルは低リスクのビジネスルールテストへの使用のみ推奨される。すべての判断は今回のWDCDスコアおよびR1〜R3のサブスコアデータに基づいている。
約束遵守能力はモデルパラメータの付属品ではなく、本番プロセスが長期安定的に機能するための核心的な競争優位である。
データ出典:YZ Index WDCD 約束遵守ランキング | Run #306 · 総合ランキング | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接