今回のWDCD v3.1パイロット評価において、Grok 4は94.20点で首位となり、Claude Opus 4.7とGemini 3.1 ProはそれぞれRun #242と比較して5.9点・5.6点下落した。残る9つの評価対象モデルに上昇は見られず、Top5の3〜5位はいずれも83点台にとどまった。
データの事実:明確な下落が見られたのは2モデルのみ
今回のサンプリングはworst-of-3方式を採用し、11モデルが25問の問題プールで得た得点を等加重平均した結果、Grok 4のWDCD=94.20、DeepSeek V4 Pro WDCD=87.04、Zhipu GLM-4.6 WDCD=83.92、Claude Opus 4.7 WDCD=83.52、Gemini 3.1 Pro WDCD=83.28となった。Claude Opus 4.7とGemini 3.1 Proの下落幅はいずれも5点を超え、潜在的なより高い点数帯から83点台へと後退し、3位のZhipu GLM-4.6との差は0.4点以内に縮小した。
原因分析:v3の多ターン施圧下におけるS_holdの差異
WDCD v3の問題設計は8〜12ターンの対話で構成され、まず2〜5件の並行ハード制約を設定したうえで、社会的同調・権威による特例承認・段階的侵食・サンクコストといった段階的プレッシャーを順次加え、最後にKBV復唱プローブと最終ターンの誠実性レビューによって採点を行う。S_holdの配点ウェイトは60点であり、制約の破綻が遅いほど高得点となる。Claude Opus 4.7とGemini 3.1 Proの今回の得点低下は、連続施圧フェーズのR3〜R6ターン、とりわけ安全コンプライアンスとデータ境界の2種類の制約シナリオにおいて、モデルが初期制約をより早期に放棄したことに起因する可能性が最も高く、それによってS_hold得点が低下した。v2の3ターンアンカー問題におけるR3施圧部分も2点分の配点があり、この部分の得点低下が100点換算スコアを直接押し下げる。一方Grok 4は、同じworst-of-3サンプリングのもとで94.20点を維持しており、サンクコスト増圧フェーズにおける制約保持能力の高さを示している。
選定への示唆:本番環境へのAI統合時に必要なガードレール
AIを本番プロセスに組み込む企業にとって、WDCDスコアはビジネスルールおよびエンジニアリング仕様の制約下におけるモデルの持続性を直接反映する。Grok 4の94.20点は、固定されたデータ境界やリソース制限を複数ターンにわたって継続実行する必要があるシナリオにおいて、プロンプトによる制約の再提示頻度を削減できることを意味する。Claude Opus 4.7とGemini 3.1 Proが83点台に後退したことで、安全コンプライアンス系タスクにおいては第5〜7ターンで制約ドリフトが生じやすくなるため、企業はこれらモデルのフロントに独立した制約検証レイヤーを追加するか、対話ターン数の上限を設ける必要がある。DeepSeek V4 Proの87.04点とZhipu GLM-4.6の83.92点は中間帯に位置し、S_recoverの回復能力に高い要求を課さない社内ツール用途には適しているが、重要なノードでは引き続き人手によるレビューが必要となる。
戦略的評価:守約能力の過小評価・過大評価のシグナル
今回のデータから推察すると、Grok 4の守約能力は現在の市場において過小評価されており、94.20点という得点は2位との差が7.16点に達しているが、その差はv3問題のS_holdとS_integrityの2項目に主に由来する。Claude Opus 4.7はこれまで単一ターンの表現から過大評価されていた可能性があり、今回の5.9点の下落は、連続的な権威特例承認施圧のもとで防衛限界点がより早期に現れることを示している。次回評価ではリソース制限シナリオにおける両モデルのR4〜R5ターンの性能を重点的に検証する必要があり、Claude Opus 4.7のS_kbv制約記憶スコアが依然として平均を下回る場合、長プロセスのビジネスルールシナリオにおける適用性はさらに制限されることになる。
守約能力はモデルパラメータの付随物ではなく、本番環境において定量化可能なリスクヘッジ指標である。
今回のパイロット評価はスコア変動の記録にとどまり、メインランキングには反映されていない。企業がモデルを選定する際は、WDCDスコアを全体順位のみで判断するのではなく、具体的な制約シナリオと照合して活用すべきである。
データ出典:YZ Index WDCD 守約ランキング | Run #247 · 変化追跡 | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接