WDCD v3.1守約テストにおいて、Grok 4は91.04点で第1位を獲得し、Doubao Proは58.00点で最下位となった。上位と下位の差は33.04点である。この結果は、11モデルが25問に対してworst-of-3サンプリングを行い、v3問題とv2アンカー問題を等重量で平均したものである。
ランキング構造:R3プレッシャーラウンドが得点差を決定
上位2位のGrok 4(91.04点)とDeepSeek V4 Pro(89.04点)のR3スコアはそれぞれ1.25/2と1.50/2であり、中位グループを大きく上回った。Claude Sonnet 4.6(83.72点)、GPT-o3(83.40点)、Gemini 3.1 Pro(83.36点)の3モデルのR3スコアはそれぞれ1.00/2、1.00/2、0.88/2であり、得点差は主にR2干渉後のR3パフォーマンスに由来する。GPT-5.5のR3はわずか0.50/2で、総合スコアは75.04点にとどまった。Doubao ProはR1・R2・R3のすべてが0.00/2となり、直接58.00点まで押し下げられた。
全体の満点率は49.5%、R3崩壊率は12.4%であり、社会的同調圧力・権威による特例承認・段階的要求・サンクコスト強調という4段階の連続プレッシャー後に、1割超のモデルが守約に失敗したことを示している。v2アンカー問題ではR3の配点が最も高く(2点)、そのためR3スコアが総合得点の差を直接拡大させる。
首位の要因:多段階漸進的プレッシャー下におけるGrok 4のR3パフォーマンス
Grok 4はR1=1.00、R2=0.88、R3=1.25/2であり、v3問題におけるS_hold・S_kbv・S_recover・S_integrityの4要素がバランスよく機能した。R3段階で並行ハード制約に直面しても高い生存率を維持しており、KBV復唱プローブと最終ラウンドの誠実な振り返りにおいて安定したパフォーマンスを示したことを意味する。DeepSeek V4 ProのR3は1.50/2に達したが、R2はわずか0.63であり、干渉段階ではGrok 4よりわずかに劣る結果となった。
Claude Sonnet 4.6は今回8.8点上昇しており、主にR2が低位から0.88へ回復し、R3を1.00/2に維持したことによる。GPT-5.5は5.0点上昇したが、R3は依然0.50/2にとどまり、回復能力に限界があることを示している。Doubao Proは3ラウンドすべてが0点であり、契約締結段階から有効な制約記憶を構築できないことを示す。
下位の差:Doubao ProとQwen3 Maxの制約シナリオにおける機能不全
Doubao Proはデータ境界・リソース制限・業務ルール・セキュリティコンプライアンス・エンジニアリング規範の5つのシナリオすべてにおいてR1の時点で制約が崩壊し、S_holdスコアはほぼ0に近い。Qwen3 MaxのR3はわずか0.63/2であり、中位グループより0.37〜0.62点低い。Gemini 2.5 ProのR3は1.00/2だが、総合スコアは71.96点にとどまり、v3問題における多段階プレッシャーの累積効果が顕著であることを示している。
これらの差は偶発的なものではなく、v3問題は8〜12ターンの対話を設計し、連続プレッシャーを段階的に高める構造となっている。R3崩壊率12.4%は、実際の対話において下位モデルが守約を破綻させる状況と直接対応している。
本番環境への組み込みにおけるモデル選定の示唆
企業がAIを高制約シナリオに組み込む場合、Grok 4とDeepSeek V4 Proの91点・89点水準であれば、追加ガードレールへの投資を削減できる。データ境界とセキュリティコンプライアンスのシナリオでは、R3スコアが1.25/2以上のモデルはサンクコスト圧力を受けても制約を維持できるため、本番環境への直接適用に適している。R3が0.75/2を下回るモデル(GPT-5.5・Qwen3 Max・Doubao Proなど)は、業務ルールやエンジニアリング規範のシナリオで独立した検証レイヤーを追加しなければ、連続プレッシャー下でハード制約に違反する可能性がある。
Claude Sonnet 4.6とGPT-o3は83点台に位置し、中低リスクのプロセスに適しているが、リソース制限シナリオではR2干渉後の回復パフォーマンスを引き続き監視する必要がある。
戦略的評価:守約能力が過小評価・過大評価されているシグナル
Grok 4の91.04点とDeepSeek V4 Proの89.04点の差はわずか2点であり、v3多段階プレッシャー下でトップモデル間に明確な階層が形成されていることを示す。Claude Sonnet 4.6が今回8.8点上昇したことは、そのR2回復メカニズムが次バージョンでさらに最適化される可能性を示唆しており、次回の重点検証項目となる。GPT-5.5はR3がわずか0.50/2でありながら5点の改善があったことは、S_recoverとS_integrityの要素に改善余地が存在するものの、R3プレッシャーラウンドが依然としてボトルネックであることを示している。
Doubao Proの16.0点下落と全ラウンド0点のパフォーマンスは、現在のv3.1問題プールにおけるその守約能力が市場によって過大評価されていることを示す。Qwen3 Maxの67.68点は中位グループとの差が15点超であり、本番環境への投入には同様に追加ガードレールが必要となる。次回は、R3スコアが1.00/2以上のモデルについて、セキュリティコンプライアンスシナリオにおけるS_holdの生存曲線を重点的に観察すべきである。
守約とはモデルの宣伝文句ではなく、R3プレッシャーラウンド後の実際のスコアである。
データ出典:YZ Index WDCD 守約ランキング | Run #271 · 総合ランキング | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接