Grok 4はWDCD 91.76点でWDCD守約ランキング首位に立ち、GLM-4.6は61.55点で最下位となった。首位と最下位の差は30.21点に達している。
ランキング構造:上位集中、下位は断崖
今回のWDCD v3.1パイロットテストは11モデルを対象とし、worst-of-3サンプリングを採用した。Grok 4、Gemini 3.1 Pro、GPT-o3が第一グループを形成し、スコアはそれぞれ91.76、89.59、87.86点。4位のClaude Opus 4.7は83.97点で首位との差は7.79点、グループ内の差は4点未満に収まっている。
7位のDoubao Pro 79.69点から10位のGPT-5.5 73.76点が第二グループを形成し、区間幅は5.93点。GLM-4.6は61.55点で単独最下位となり、10位より12.21点、首位より30.21点低い。
首位分析:Grok 4はR3プレッシャー段階で最高の耐性を維持
Grok 4のv2アンカー問題スコアはR1=1.00、R2=0.88、R3=1.25/2であり、換算後も総合首位を支えている。R3段階は連続プレッシャー下のサンクコストおよびサラミ戦術に対応しており、Grok 4はこのラウンドで最高得点を記録した。これは多段階漸進的プレッシャー下での守約継続能力が最も高いことを示している。
一方、Gemini 3.1 ProのR3スコアは1.38/2とわずかに高いが、R2は同点であり、総合ではGrok 4に2.17点差をつけられた。GPT-o3のR3はわずか0.75/2にとどまり、総合スコアを3位に引き下げた。
最下位分析:GLM-4.6は全アンカー問題で完全に守約失守
GLM-4.6のR1、R2、R3スコアはいずれも0.00/2であり、前回から29.8点下落した。今回のテストにおいてv2アンカー問題の3ラウンド全てでゼロ点となった唯一のモデルであり、制約注入・干渉・プレッシャーの三段階いずれにおいても初期の約束を維持できなかったことを示している。
同モデルはv3問題のS_hold(守約継続)スコアが極めて低いとみられ、全体スコアを15点底上げするS_integrityスコアによっても補いきれない状況だ。全体のR3崩壊率は9.4%であり、GLM-4.6はその中で顕著な割合を占めている。
上位グループと下位との差が生じるメカニズム
差は主にv3問題の連続プレッシャー段階とv2アンカー問題のR3ラウンドに集中している。上位モデルは8〜12ターンの対話において、社会的同調・権威による特例承認・サラミ戦術に直面しても、初期の2〜5件のハード制約に対するS_holdスコアを高く維持できる。一方、下位モデルはKBV(Key Binding Verification)復唱プローブの前に既に守約が崩れており、S_recover(回復能力)が不足している。
データセキュリティ境界と安全コンプライアンスシナリオにおける制約が最も差を露わにしやすい。GLM-4.6はエンジニアリング規範類の制約下で最も早く失効する可能性があり、Grok 4はリソース制限およびビジネスルールシナリオでより安定したパフォーマンスを示している。
生産プロセスへの導入におけるモデル選定への示唆
AIを生産プロセスに組み込む企業が安全コンプライアンスやデータ境界シナリオにおいて、WDCDスコア90点以上のモデルを優先選択することでガードレールへの投資を削減できる。Grok 4とGemini 3.1 ProのS_holdスコアは、リアルタイム監視の削減を支持する。
リソース制限およびエンジニアリング規範シナリオでは、73点未満のモデルには事後監査と人的レビューの追加が必要となる。GLM-4.6の61.55点は、ガードレールなしでの運用には不適切であることを示しており、ハード制約を伴う全てのビジネスルールに追加の隔離レイヤーが必要だ。
ビジネスルールシナリオでは、Claude Opus 4.7(83.97点)をバランス型の選択肢として検討できる。そのR3スコア1.25/2はGrok 4と近い水準にある。
戦略的判断:守約能力の過小評価と検証が必要なシグナル
Grok 4の守約能力は市場に過小評価されている可能性があり、91.76点とR3段階での1.25/2という得点は、最も厳しいプレッシャー下でも高い整合性を維持していることを示している。次期v3.2において多段階漸進的プレッシャー下のS_recoverパフォーマンスを重点的に検証する価値がある。
GLM-4.6の29.8点下落シグナルは、制約記憶能力に明確な退化が生じていることを示しており、次期ではv2アンカー問題のR1段階でゼロ以外のスコアを回復できるかどうかを観察する必要がある。
GPT-5.5の73.76点は前回比6.0点下落しており、R3スコアはわずか0.88/2にとどまる。これはサンクコストプレッシャー下での回復能力が過大評価されていた可能性を示唆している。
守約能力はモデルの規模に付随するものではなく、生産運用における真の競争優位の源泉である。
データ出典:YZ Index WDCD守約ランキング | Run #331 · 総合ランキング | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接