4モデルのWDCDスコアが一斉上昇、下落ゼロ――Grok 4が94点でトップ維持

今回のWDCD v3.1パイロット評価では、Doubao Pro・Gemini 2.5 Pro・GLM-4.6・Qwen3 Maxの4モデルのスコアがそれぞれ10.2点・8.1点・6.8点・7.6点上昇し、その他の評価対象モデルに下落は記録されなかった。Grok 4は94.00点で首位に立ち、GLM-4.6は88.93点で2位につけた。

データの事実:上昇は特定の制約シナリオに集中

4モデルの上昇幅はいずれも6点を超え、v3問題の8〜12ターン目の後半対話に集中している。GLM-4.6は前回水準から88.93点へ上昇し、Top 5の2位に浮上した。DeepSeek V4 Proが88.14点でこれに続き、Claude Sonnet 4.6とGemini 3.1 Proがそれぞれ86.69点・86.48点で4位・5位となった。上昇した全モデルにおいて、S_hold(約定遵守サバイバル)項目のスコアが顕著に改善しており、この項目の配点は60点で、約定破棄が遅いほど高得点となる。

要因分析:多ターンの圧力下における制約記憶の差異

WDCD v3の問題設計には、約定締結後の連続加圧とKBV復唱プローブが含まれる。上昇したモデルは、リソース制限および安全コンプライアンスの2種類の制約シナリオでより安定したパフォーマンスを示した。Doubao Proは10.2点上昇しており、「サラミ戦術」的な段階的加圧への耐性が強化されたことが主因と考えられ、S_kbv(制約記憶、15点)の得点も相応に向上している。Gemini 2.5 Proは8.1点、Qwen3 Maxは7.6点それぞれ上昇し、いずれも権威による特別承認を装った加圧ターンにおける早期の約定破棄が減少したことを示している。GLM-4.6は6.8点上昇して上位2位に入り、S_recover(防御突破からの回復、10点)項目でも改善が見られる可能性がある。

一方、Grok 4は94.00点の高水準を維持しており、サンクコスト型加圧および最終ターンでの誠実な自己申告の環節において依然として優位性を持つことを示している。v2アンカー問題の換算後等加重平均の結果によれば、上昇したモデルはR3加圧ターンでの得点貢献がより大きい。

モデル選定への示唆:業務プロセス接続の実際的な境界

AIを業務プロセスに組み込む企業にとって、WDCDスコアは信頼できる制約実行能力に直結する。Grok 4の94.00点は、データ境界およびエンジニアリング規範のシナリオに適しており、追加のガードレールなしで使用可能なことを示している。GLM-4.6の88.93点とDeepSeek V4 Proの88.14点は近接しており、リソース制限タスクに適しているが、安全コンプライアンスシナリオでは二次検証の設定が引き続き必要である。Claude Sonnet 4.6の86.69点とGemini 3.1 Proの86.48点はビジネスルール執行に活用できるが、多ターン対話が8ターンを超える場合は人的レビューのノードを追加することが推奨される。

Doubao Proは今回大幅に上昇しており、ビジネスルールシナリオにおける約定遵守の安定性が向上したことを示唆しており、社内ツールチェーンでのパイロット範囲を拡大できる状況にある。

戦略的判断:制約遵守能力が過小評価されているシグナル

4モデルが一斉に上昇し、下落ゼロという構図は、現バージョンv3.1がプロンプト感度の変化をより精緻に捉えていることを示している。GLM-4.6が88.93点へと大きく躍進したことは、その制約記憶能力が市場に過小評価されている可能性を示唆しており、次回評価ではエンジニアリング規範シナリオにおけるS_integrity(誠実な自己申告)のパフォーマンスを検証する必要がある。Grok 4は94.00点の高水準を維持しており、制約遵守能力は過大評価されていない。

分析によれば、上昇したモデルに共通するのはKBV復唱プローブの通過率向上であり、これはモデルのアップデートまたはトレーニングにおいて複数制約の並列処理が強化されたことによる可能性がある。企業がモデルを選定する際、94点以上のモデルは高リスクのコンプライアンスプロセスに直接適用可能であり、85〜90点区間のモデルはビジネスルールシナリオにガードレールを追加する必要がある。

次回評価では、GLM-4.6とQwen3 Maxのv3問題最終ターンでの誠実な振り返り環節におけるS_integrityスコアが引き続き上昇するかどうかを重点的に観察する必要がある。

総合的な判断として、WDCD v3.1パイロット評価は制約遵守能力の分化が進んでいることを明らかにした。Grok 4の94.00点は依然として現時点で最も信頼性の高い基準であり、GLM-4.6の88.93点は追い上げの圧力を形成しつつある。企業は汎用ランキングだけを参照するのではなく、具体的な制約シナリオの種類に応じてモデルを選定すべきである。


データ出典:YZ Index WDCD 約定遵守ランキング | Run #291・変化追跡 | 評価方法論