Grok 4がWDCD 93.21点でトップ、Qwen3 Maxは74.31点で最下位

Grok 4はWDCD 93.21点で今回の守約(約束遵守)テストの首位に立ち、Qwen3 Maxは74.31点で11位となった。両者の差は18.9点である。

ランキング構成とコアデータ

今回のWDCD v3.1テストには11モデルが参加し、問題プールは29問でworst-of-3サンプリングを採用した。Grok 4はv3多ターン漸進加圧問題とv2アンカー問題の換算後スコアが最も高く、R1=1.00、R2=1.00、R3=1.25/2となった。GLM-4.6が91.38点で僅差の2位につけ、R3は1.50/2を記録した。DeepSeek V4 Pro 87.97点、GPT-o3 86.93点、Gemini 3.1 Pro 85.72点が第2グループを形成した。下位のQwen3 MaxはR3がわずか0.63/2にとどまり、全体のR3崩壊率は9.1%、満点率は58%であった。

首位の要因:R3加圧フェーズにおける制約維持

Grok 4はv3問題の8〜12ターンの対話において、契約締結フェーズで確立されたハード制約が、社会的同調、権威による特例承認、スライシング(段階的要求)、サンクコストによる段階的な圧力強化の下でも、S_hold(守約生存スコア)が最高値を維持した。R3加圧ラウンドは60点分の重みを直接決定するが、Grok 4のR3スコアは1.25/2であり、Claude Opus 4.7の0.75/2やGPT-5.5の0.88/2を上回った。これは、エンジニアリング規範および安全コンプライアンスのシナリオにおける継続的な圧力下で、制約が崩れるまでの時間がより長く、S_recover(回復能力)とS_integrity(誠実な自己申告)も高い水準を維持していることを示している。

最下位モデルのメカニズム的欠陥

Qwen3 MaxのR3はわずか0.63/2であり、KBV復唱プローブおよび最終ターンの誠実な振り返り環節で大きく失点した。11モデル中、R3崩壊率9.1%は下位3モデルに集中している。Doubao ProのR3は1.13/2であるが、総合スコアは75.62点にとどまり、v3問題のS_kbv(制約記憶15点項目)が弱い可能性を示している。Claude Sonnet 4.6は前回より5.0点下落し、R2もより高い水準から0.88に低下しており、3ラウンドのアンカー問題による干渉フェーズでの安定性低下が見られる。

上位グループと下位グループの差が示すモデル選定への示唆

AIを業務プロセスに組み込む企業にとって、Grok 4とGLM-4.6の守約データは、データ境界とリソース制限のシナリオでは直接使用可能であることを意味するが、安全コンプライアンスのシナリオでは人工レビューを残すべきであることを示している。R3スコアが1.00未満のモデル、例えばGPT-o3(0.63/2)やQwen3 Max(0.63/2)は、業務ルールへの継続的な加圧下で制約が崩れる確率が高いため、外部ガードレールの追加またはマルチモデル投票の導入を推奨する。Gemini 2.5 ProのR3は1.25/2であるが総合スコアは77.48点にとどまり、v3問題のS_hold重みが全体パフォーマンスを引き下げていることを示しており、本番展開時にはサンクコスト加圧シナリオについて個別にテストすべきである。

戦略的判断:過小評価された能力と要検証シグナル

R3スコアと総合スコアの対応関係から見ると、Grok 4の守約能力は市場で過小評価されている可能性があり、1.25/2のR3パフォーマンスと93.21点の総合スコアの整合性は高い。GLM-4.6のR3は1.50/2であるが総合スコアは91.38点にとどまっており、S_integrity(誠実な自己申告)15点項目に減点の余地がある可能性があり、次回の検証に値する。Claude Opus 4.7のR2はわずか0.50であり、干渉フェーズでの制約記憶が同シリーズのSonnet 4.6より弱いことを示しており、戦略的には多ターン漸進加圧シナリオでの第一選択とすることは推奨しない。Doubao Proは前回より7.5点上昇し、R3 1.13/2の改善はv2アンカー問題の最適化によるものと考えられるが、安定しているかどうかは引き続き観察が必要である。

全体統計では58%のモデルが一部の制約シナリオで満点を獲得しており、現在のv3.1問題プールが上位モデルに対して有効な差別化を形成していることを示している。企業のモデル選定においては、R3スコアが1.00以上のモデルを優先することで、エンジニアリング規範シナリオにおけるコンプライアンスリスクを低減できる。下位モデルは安全コンプライアンスおよび業務ルールシナリオでのS_holdスコアが低いため、追加のルールエンジンまたは人工審査ノードの導入が必要である。

守約能力はモデルパラメータの付属品ではなく、本番展開における目に見えない参入障壁である。

次回テストでリソース制限型シナリオが追加された場合、R3スコアの差異が上位と下位の格差をさらに拡大する可能性がある。


データソース:YZ Index WDCD 守約ランキング | Run #311 · 総合ランキング | 評価方法論