WDCD守約ランキング GPT-o3が94点で首位、Qwen3 Maxが62.6点で最下位

GPT-o3は94.00点でWDCD v3.1守約ランキングの首位を獲得し、Qwen3 Maxは62.60点で最下位となった。評価対象の11モデルにおいて、首位と最下位の差は31.4点となっている。

ランキング構造:3層への分化とR3の重要な役割

今回のWDCDはworst-of-3サンプリングを採用し、v3問題とv2アンカー問題を等加重で平均している。GPT-o3、Grok 4、Claude Opus 4.7の3モデルが第1グループを形成し、スコアはそれぞれ94.00、87.90、87.60で、相互の差は7点未満である。第2グループはGemini 3.1 Proの87.30からZhipu GLM-4.6の78.30まで広がり、区間内の9点差は主にR3の加圧スコアの差に起因する。下位ではDoubao Proの63.40点とQwen3 Maxの62.60点が中位グループとの差を明確に広げている。

R3の崩壊率はわずか3.6%に過ぎないが、最終ランキングを直接左右する。DeepSeek V4 ProはR3で満点の2点を獲得したものの、総合スコアは依然5位にとどまり、v3問題の多段階漸進的加圧フェーズでの失点が多いことを示している。一方、Gemini 3.1 ProはR3で0点を獲得したにもかかわらず、v3問題のS_holdとS_kbvの高得点により4位を維持しており、早期の制約記憶能力が最終ラウンドの崩壊を部分的に補完できることを証明している。

要因分析:制約シナリオと加圧ラウンドの差異

5種類の制約シナリオのうち、安全コンプライアンスとエンジニアリング規範のシナリオがR3崩壊を最も引き起こしやすい。GPT-o3はすべてのシナリオでR1=1、R2=1、R3=1を維持しており、「サラミ戦術」と「サンクコスト」による段階的な加圧への耐性が最も強いことを示している。Qwen3 MaxとZhipu GLM-4.6はR3フェーズで複数回0点を獲得しており、リソース制限やビジネスルールのシナリオにおいて社会的同調圧力により初期制約を放棄しやすいと推測される。

Claude Sonnet 4.6は今期15.0点上昇し、主にv3問題のS_recoverとS_integrityの2項目の回復によるもので、KBVの復唱プローブ後における誠実な自己報告能力が明らかに向上したことを示している。Zhipu GLM-4.6は15.3点下落し、R3での0点記録と合わせて、連続8〜12ラウンドの対話における制約記憶の減衰がより速いことを示唆している。

モデル選定の意味:本番プロセス接続における実際のリスク境界

AIを本番プロセスに組み込む企業にとって、WDCD 94.00点のGPT-o3はデータ境界と安全コンプライアンスのシナリオで直接使用可能であり、ガードレールを最小限に抑えることができる。87点区間のGrok 4とClaude Opus 4.7はリソース制限型タスクに適しているが、エンジニアリング規範のシナリオでは依然として人的レビューのノードを維持する必要がある。

62〜63点のQwen3 MaxとDoubao Proはビジネスルールのシナリオで制約突破の確率が著しく上昇するため、企業はこれらのモデルの前に独立した制約検証レイヤーを追加するか、低リスクの社内Q&Aにのみ使用すべきである。DeepSeek V4 ProはR3で満点を獲得したものの、総合84.30点は依然として第1グループを下回るため、多ラウンドの長い対話シナリオでは外部メモリアンカーを重ねて使用することを推奨する。

戦略的判断:過小評価と過大評価のシグナル

Claude Sonnet 4.6が単期で15.0点上昇したことは、その守約能力がこれまで市場に過小評価されていた可能性を示しており、次期にR3スコアを維持できれば第1グループの競争に加わることになる。Zhipu GLM-4.6は2期連続のデータでR3フェーズの脆弱性を示しており、次期において安全コンプライアンスシナリオでの修復パスを重点的に検証する価値がある。

GPT-o3の94.00点のリード優位は、worst-of-3における最低スコアでも高得点を維持していることに基づいており、その守約の安定性が再現可能なメカニズム上の優位性を形成していることを示している。下位モデルと首位との31.4点の差は、短期的に単一バージョンのアップデートで埋めることは難しく、企業のモデル選定においてWDCDスコアを参考指標ではなく必須の参入基準として扱うべきである。

守約能力はモデルのサイズの副産物ではなく、本番環境での利用可能性を支える核心的な競争優位である。

データソース:YZ Index WDCD 守約ランキング | Run #233 · 総合ランキング | 評価方法論