WDCD v3.1守約テストにおいて、Grok 4は94.00点で第1位を獲得し、Doubao Proは68.17点で第11位となった。両モデルのR3施圧ラウンド得点はそれぞれ1.50/2と0.88/2であり、この差が総合スコアに25.83点の開きを直接生み出した。
ランキング構造:上位集中、下位断層
上位5モデルのWDCDスコアは86.48〜94.00の範囲に分布し、6〜8位は80.07〜84.79、9〜10位は75.31〜77.72に落ち込み、11位のDoubao Proは68.17点で明確な断層を形成している。v2アンカー問題の換算後、Grok 4のR1+R2+R3合計は3.50/4であるのに対し、Doubao Proはわずか2.26/4にとどまり、下位モデルが初期制約注入フェーズのR1段階ですでに0.37点の減点を受けていることを示している。
首位分析:Grok 4のR3パフォーマンス
Grok 4は17問のv3問題におけるS_hold守約サバイバル次元で最高得点を記録し、R3施圧ラウンドで1.50/2を獲得した。このモデルは社会的同調、権威による特例承認、サラミ戦術の3種の施圧手法に対して、約束破りが最も遅いタイミングで発生し、S_recover防御回復とS_integrity自己申告誠実性の両項目も高水準を維持した。一方、Claude Opus 4.7も同様にR1は満点の1.00を獲得したが、R3はわずか1.25/2にとどまり、総合スコアで9.45点劣後しており、連続8〜12ターンの対話における制約維持能力がGrok 4に及ばないことを示している。
最下位の原因:Doubao ProのR1における欠陥
Doubao ProはR1得点が1.00を下回る唯一のモデルであり、わずか0.63点に過ぎない。これは、制約設定フェーズの段階で2〜5件の並行ハード制約を完全に記憶できないことを意味する。その後のR2干渉およびR3施圧においてS_kbv制約記憶得点が影響を受け、総合スコアが10位のQwen3 Maxを7.14点下回る結果となった。v3問題のKBV復唱プローブ段階では、Doubao Proは第6〜8ターン以降に制約の忘却が最も起きやすいことが示されている。
上位グループ対下位グループ——差異のメカニズム分析
上位3モデルであるGrok 4、GLM-4.6、DeepSeek V4 ProのR3平均得点は1.38/2であるのに対し、下位3モデルであるGPT-5.5、Qwen3 Max、Doubao ProのR3平均はわずか0.88/2にとどまった。この差は主にデータ境界とセキュリティコンプライアンスの2種類の制約シナリオに由来しており、これらのシナリオはv3問題の中で施圧ラウンドが最長で、サンクコスト圧力が最も顕著に現れる。エンジニアリング規範類の制約シナリオでは各モデルのR3得点差は小さく、現時点でのモデルはコードレベルのルール遵守において相対的に均衡していることを示している。
本番環境への導入における選定上の意味
AIを本番環境に導入する企業において、業務ルールとセキュリティコンプライアンスの要件が厳格な場合、Grok 4の94.00点とR3の1.50/2のパフォーマンスが第一候補となり、複数ターン対話インターフェースの直接公開に適している。GLM-4.6とDeepSeek V4 Proは約88点でスコアが近く、リソース制限のある環境での使用が可能だが、データ境界シナリオでは外部検証を追加で設定する必要がある。Doubao Proは68.17点であり、R1フェーズの時点で0.37点を失っているため、並行ハード制約が必要な本番ワークフローでの使用は推奨されない。単ターンQAへの限定使用か、人手によるレビューノードの追加が望ましい。
戦略的判断:過大評価・過小評価されているモデル
Claude Sonnet 4.6は第4位(86.69点)にランクインし、R2得点は0.75とDeepSeek V4 Proの0.63を上回っているが、R3はわずか0.88/2にとどまっており、中期の干渉フェーズでは優れたパフォーマンスを示す一方で、最終ラウンドの施圧下では約束破りが起きやすいことを示している。このモデルの守約能力は市場で過大評価されている可能性がある。Qwen3 Maxは第10位(75.31点)で、R1とR2はいずれも1.00を達成しているが、R3の1.13/2が総合スコアを引き下げており、長い対話における制約維持の実力は過小評価されている可能性がある。次回テストでは11ターン以上の対話におけるS_holdの変化を重点的に観察する必要がある。
前回との比較では、Doubao Proが10.2点、GLM-4.6が6.8点それぞれ向上しており、主にR3得点の改善によるものであり、連続施圧下における回復能力の進歩を示している。ただし、全体のR3崩壊率は依然として8.2%に達しており、上位モデルであっても最悪のサンプリングで約束破りが発生する確率が8.2%存在することを示している。
企業がモデルを選定する際は、総合スコアのみではなくR3得点を優先的に確認すべきであり、R3が1.00/2を下回るモデルはセキュリティコンプライアンスのシナリオにおいて追加のガードレールが必要である。
次回の検証では、5種類の制約シナリオの細分化得点、特に現在差異が小さいリソース制限とエンジニアリング規範の2カテゴリに焦点を当て、新たな断層が生じるかどうかを観察すべきである。
データ出典:YZ Index WDCD守約ランキング | Run #291・総合ランキング | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接