Grok 4がWDCD守約ランキングで93.80点首位、GLM-4.6は68点で最下位——差は25.8点

WDCD v3.1守約テストの結果、Grok 4が93.80点で首位、GLM-4.6が68.00点で最下位となり、両者の差は25.8点となった。評価対象11モデルの平均スコアには明確な断層が見られ、上位4モデルはいずれも83点を超え、下位3モデルは72点を下回った。

ランキング構造とR3加圧の差異

今回のテストはworst-of-3サンプリングを採用し、v3問題とv2アンカー問題を等ウェイトで平均した。Grok 4はv2アンカー問題においてR1=1.00、R2=1.00、R3=1.50/2を記録し、3ラウンドにわたる段階的干渉を経た後もR3スコアの75%を維持した。GPT-o3が89.80点で続くが、R3は0.50/2にとどまり、Grok 4より1点低い。Claude Sonnet 4.6は87.20点で3位となったが、R3で満点2.00/2を獲得した一方でR2フェーズは0点であり、連続加圧の第2ラウンドで制約の緩みが顕著に生じたことを示している。

下位モデルに共通する特徴はR3フェーズの全面崩壊である。GLM-4.6はR1・R2・R3がすべて0点であり、初回の制約注入後にいかなるアンカーも維持できないことを示している。Qwen3 MaxはR1・R2でそれぞれ1点を獲得したものの、R3は0点となり、最終スコアは71.60点にとどまった。Gemini 2.5 ProとClaude Opus 4.7も同様にR3フェーズでゼロとなり、それぞれ10位と8位に位置した。

原因分析:R3崩壊と制約シナリオの分布

全体のR3崩壊率は9.1%だが、下位モデルの崩壊はリソース制限と安全コンプライアンスの2種類の制約シナリオに集中している。GLM-4.6は5つのシナリオすべてでR3加圧をクリアできておらず、埋没コスト型の加圧フェーズで初期のハード制約を最も放棄しやすいことを示している。Qwen3 Maxはデータ境界シナリオでは比較的良好な結果を示したが、エンジニアリング規範シナリオのR3フェーズで直接崩壊しており、その制約記憶がシナリオに依存していることが分かる。

上位モデルの差異は主にS_hold守約サバイバル指標に由来する。Grok 4の高得点は制約崩壊が起きないわけではなく、崩壊のタイミングが遅いことによるものである。Claude Sonnet 4.6はR3で満点を獲得したが、S_kbv制約記憶スコアが低く、KBV復述プローブフェーズで部分的な忘却が生じていることを示している。

業務フローへの導入における選定上の意味

AIを業務フローに組み込む企業はR3フェーズの性能に特に注目する必要がある。Grok 4はリソース制限・業務ルールシナリオのR3で1.50点を維持しており、複数ラウンドにわたるツール呼び出しと予算上限管理が必要なシナリオに適している。GPT-o3とClaude Sonnet 4.6は安全コンプライアンスシナリオのR3で明確に分化しており、前者のR3は0.50点、後者は満点であることから、コンプライアンス境界を伴う承認フローにはClaude Sonnet 4.6がより適している。

下位モデルは長期的な制約維持を要するパイプラインに直接使用すべきではない。GLM-4.6は全シナリオでR3が0点であり、連続加圧型の対話に入ると、初期に設定されたデータ境界やエンジニアリング規範が突破されやすい。こうしたモデルを使用せざるを得ない企業は、モデル自身の守約能力に依存するのではなく、R2フェーズの時点で外部ガードレールを導入する必要がある。

戦略的判断と次回検証シグナル

Claude Opus 4.7は今回、前回比で17.0点下落し、R2フェーズも0点となっており、連続干渉下での制約維持能力が明確に低下したことを示している。これはv3問題プールで追加されたスライス型加圧ラウンドと関係している可能性がある。Geminiシリーズの2モデルはともに18点超の下落となり、Gemini 2.5 Proは10位まで後退し、v3の多ラウンド段階的加圧下での性能がv2アンカー問題と大きく乖離していることが示された。

DeepSeek V4 ProとGPT-o3はともに5.0点下落したが、前者のR3は1.00点を維持し、後者は0.50点にとどまっており、DeepSeekが回復力においてより優位である可能性を示している。Qwen3 MaxはR2で満点を獲得しながらR3でゼロになった唯一のモデルであり、社会的同調型加圧下での性能は次回重点的に追跡する価値がある。

今回の試験運用フェーズにおけるworst-of-3の基準は下位モデルの変動を拡大させており、今後平均スコアを採用した場合、GLM-4.6とGemini 2.5 Proの相対的順位が変動する可能性がある。企業がモデルを選定する際は、業務環境における制約失効リスクを低減するため、R3スコアが1.00を超えるモデルを優先的に参照すべきである。

守約能力はモデルパラメータの付属品ではなく、そのモデルが業務クローズドループに真に組み込めるかを決定するハードルである。

データ出典:YZ Index WDCD守約ランキング | Run #316 · 総合ランキング | 評価方法論