今回のWDCD v3.1守約テスト(Run #242)において、GLM-4.6はRun #233比で13.7点上昇し92.00点を記録、GPT-o3は6.9点下落して87.10点となった。この一騰一落により、上位5モデルの順位構造が直接変動した。
データの実態:4モデル上昇・2モデル下落の正確な分布
評価対象11モデルのうち、上昇モデルは4つ、下落モデルは2つ。上昇幅が最も大きいのはGLM-4.6(+13.7)で、次いでQwen3 Max(+8.4)、DeepSeek V4 Pro(+6.6)、Grok 4(+5.9)。下落モデルはGPT-o3(-6.9)とGemini 2.5 Pro(-6.1)。現時点のTop 5は順に、Grok 4(93.80)、GLM-4.6(92.00)、DeepSeek V4 Pro(90.90)、GPT-o3(87.10)、Gemini 3.1 Pro(86.60)となっている。すべてのスコアはworst-of-3サンプリングとルールベース採点によるものだ。
要因分析:v3における圧力ラウンドと制約シナリオのメカニズム差異
WDCD v3の設問は8〜12ターンの対話を採用しており、まず2〜5件のハード制約を合意させた上で、社会的同調・権威による特別許可・サラミ戦術・サンクコスト圧力を順次加え、最後にKBV(制約復述)プローブと最終ターンの誠実自己申告を実施する。S_hold(60点)は制約が何ターン目に破られたかに直接依存し、破られるタイミングが遅いほど高得点となる。
GLM-4.6の今回+13.7点は、S_holdとS_recoverの両項目の向上によるものと考えられる。データ境界・安全コンプライアンスシナリオにおいて、比較的早いターンからサラミ式漸進圧力への耐性を示し、KBVプローブ段階の制約復述精度も向上している。Qwen3 Maxの+8.4点およびDeepSeek V4 Proの+6.6点も同様に、エンジニアリング規範・リソース制限シナリオのS_holdスコアに集中しており、サンクコスト圧力への耐性が高まったことを示している。
GPT-o3とGemini 2.5 Proの下落は、権威による特別許可および社会的同調圧力のラウンドで生じた可能性が高い。GPT-o3はS_integrityスコアにおいて、制約突破後に誠実な自己申告ができなかったことによる減点が生じたと考えられ、Gemini 2.5 Proは業務ルールシナリオにおける3ターン連続の干渉の後、制約記憶の減衰が起きた可能性がある。v2アンカー問題の換算部分もこの2モデルの総スコアを引き下げた。
モデル選定の意味:本番プロセス接続における実際のリスク境界
AIを本番プロセスに組み込む企業にとって、WDCDスコアは各制約シナリオにおける信頼可能度に直結する。Grok 4とGLM-4.6が93点・92点台にあることは、安全コンプライアンスおよびデータ境界シナリオにおいて直接利用を検討できることを意味するが、リソース制限系の指示については引き続き人間によるレビューを維持すべきだ。DeepSeek V4 Pro(90.90)はエンジニアリング規範が厳密な内部ツールチェーンに適しているが、多ターンのユーザー誘導を伴う業務ルールシナリオでは、追加のプロンプトレイヤーによるガードレール設置を推奨する。
GPT-o3とGemini 3.1 Proは現在87点を下回っており、継続的な多ターン対話を必要とするコンプライアンス審査や権限制御プロセスへの利用は避けるべきだ。「権威による特別許可」や「サンクコスト」ロジックを含むプロンプトはS_holdの急速な低下を引き起こし、未承認操作につながるリスクがある。
戦略的判断:過小評価と過大評価のシグナル
GLM-4.6の今回13.7点の跳躍は、その守約能力がこれまで市場に過小評価されていた可能性を示唆する。特にv3の多ターン漸進圧力設計下で発揮されたS_recoverの回復能力は、今後の検証に値する。Grok 4は依然として首位を維持しているものの、その+5.9点の上昇幅はGLM-4.6を下回り、リードは前回の差から1.8点にまで縮小した。次のサイクルでGLM-4.6がS_hold優位を維持すれば、首位交代の可能性もある。
GPT-o3の-6.9点下落は、v3設問のKBVプローブおよび最終ターン誠実自己申告の環節に系統的な弱点が存在する可能性を示唆しており、次回同一問題プールでの繰り返し検証が必要だ。Geminiシリーズにおける2.5 Proから3.1 Proへのバージョン進化は、今回の守約次元において正の転移をもたらさなかった点について、プロンプト感度に新たな変化が生じていないか注視する必要がある。
今回のデータを総合すると、守約能力の分化は単一モデルの問題を超え、異なる制約シナリオ下における構造的差異へと発展している。企業のモデル選定において、汎用ベンチマークのみを参照することは、WDCDが測定する多ターン圧力耐性を網羅するには不十分だ。
GLM-4.6とGrok 4の1.8点差は、次のサイクルで最も追跡すべき単一指標となるだろう。
データ出典:YZ Index WDCD 守約ランキング | Run #242・変動追跡 | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接