Grok 4は96.30点でWDCD v3.1守約総合ランキング首位を獲得し、Doubao Proは67.90点で最下位となり、両者の差は28.4点に達した。評価対象の11モデルのうち、上位3モデル(Grok 4、GPT-o3の95.20点、GLM-4.6の93.70点)の平均スコアは95.07点、下位3モデル(Qwen3 Maxの71.50点、Gemini 2.5 Proの71.00点、Doubao Proの67.90点)の平均スコアは70.13点で、その差は24.94点に達した。
ランキング構造:上位は安定、下位は断絶
今回のパイロット版ランキングはworst-of-3サンプリングとルールベース採点を採用し、v3問題とv2アンカー問題を同等ウェイトで平均算出している。Grok 4はS_hold(約束遵守生存)、S_kbv(制約記憶)、S_recover(突破後の回復)の3項目すべてで高水準を維持し、R3加圧ラウンドでも崩壊は見られなかった。GPT-o3がわずか1.1点差で続き、複数ラウンドにわたる漸進的加圧下での制約記憶能力がトップレベルに迫っていることを示した。GLM-4.6は93.70点で3位につけ、4位のDeepSeek V4 Pro(92.20点)との差はわずか1.5点で、明確な第1グループを形成している。
6位から8位が第2グループを構成する:Gemini 3.1 Proが88.20点、Claude Opus 4.7が85.80点、GPT-5.5が83.30点。この3モデルと上位グループとの差は8〜13点で、主な失点はS_integrity(誠実な自己申告)次元で発生した。下位3モデルはS_hold項目で顕著な低下を示し、Doubao Proは67.90点と前回比6.6点減、Gemini 2.5 Proは12.5点減、Qwen3 Maxは71.50点を維持しており、全体として上位グループとの断絶が生じている。
首位の要因:複数ラウンド加圧下でのS_hold優位
Grok 4の高得点は、v3問題における8〜12ラウンドの対話中の約束設定フェーズおよび連続加圧フェーズによるところが大きいと考えられる。v3問題では、まず2〜5件の並行ハード制約を設定し、次いで社会的同調・権威による特別承認・サラミスライシング・サンクコストの4種類の圧力を順次加える。Grok 4は最も遅い約束違反ラウンドにおいて最高スコアを記録し、S_hold(60点満点)の貢献が際立った。一方、Doubao ProとGemini 2.5 ProはR3加圧ラウンドでより早期に約束を破り、S_holdで大きく失点した。全体のR3崩壊率は依然0%だが、worst-of-1サンプリングの結果は、エンジニアリング規範・安全コンプライアンス場面における各モデルの実際の耐圧能力を差別化するに足るものとなっている。
最下位の分析:S_integrityとS_recoverの双方が低水準
Doubao Proの67.90点とQwen3 Maxの71.50点は、S_integrity(誠実な自己申告)項目で最も低い結果となった。v3問題の最終ラウンドでは、モデルが自身の制約違反を誠実に振り返ることが求められるが、違反しながら問題なかったと虚偽申告した場合は直接0点となる。下位モデルはKBV(制約記憶検証)プローブ後のS_recoverも低く、一度制約が突破されると、後続ラウンドで自律的にコンプライアンス状態に回復することが困難であることを示している。これは、突破後も部分的なS_recoverスコアを維持できる上位モデルとの対照をなしている。
モデル選定の意味:AIを業務フローに組み込む際の実際のリスク境界
AIを業務フローに組み込む企業にとって、WDCDのデータは3つの具体的な判断基準を示している。第1に、データ境界および安全コンプライアンス場面では、Grok 4とGPT-o3の96点・95点水準は高付加価値フローへの直接適用が可能で、ガードレールの追加要件は低い。第2に、リソース制限およびビジネスルール場面では、Claude Sonnet 4.6(91.60点)とDeepSeek V4 Pro(92.20点)はすでに利用可能な水準に達しているが、R3レベルの加圧シミュレーションテストの実施は依然として必要である。第3に、Qwen3 Max・Gemini 2.5 Pro・Doubao Proの3モデルはエンジニアリング規範場面でのS_holdスコアが低く、長期にわたって複数の並行制約を維持する必要がある業務チェーンへの直接適用は推奨されず、外部検証レイヤーの追加が必須である。
戦略的判断:過小評価・過大評価のシグナル
今回、Claude Sonnet 4.6は13.5点上昇、DeepSeek V4 Proは6.9点上昇、GPT-o3は6.4点上昇しており、これらの上昇はv3問題における複数ラウンド漸進的加圧の強化によるものと考えられ、制約記憶メカニズムが反復的改善により向上したことを示している。GPT-5.5は5.3点低下、Claude Opus 4.7は5.7点低下、Gemini 2.5 Proは12.5点低下しており、S_integrityとS_recoverにおける相対的弱点が市場で過大評価されている可能性を示唆している。次回検証すべきシグナルは、上位モデルがリソース制限場面でS_holdのリードを維持できるか、および下位モデルが単一ラウンド回復訓練によってS_recover格差を縮小できるか、という点である。
今回のパイロット段階は主要ランキングの採点対象外だが、実際の複数ラウンド対話圧力下における各モデルの約束遵守生存能力の差異がすでに明らかになった。企業がモデルを選定する際、汎用ベンチマークのみを参照することは、本番レベルの制約要件をカバーするには不十分であり、WDCD v3.1のworst-of-3ルールベース採点結果はより実際の導入リスクに近い指標を提供している。
約束の遵守はモデルの付加機能ではなく、業務フローを長期運用できるかどうかを左右する根本的な前提条件である。
データ出典:YZ Index WDCD 守約ランキング | Run #296 · 総合ランキング | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接