今回のWDCD v3.1テストでは、Qwen3 Maxのスコアが20.2ポイント上昇、GLM-4.6が19.9ポイント上昇、Claude Sonnet 4.6が7.6ポイント上昇、Gemini 2.5 Proが11.3ポイント上昇、Grok 4が6.4ポイント上昇し、評価対象11モデルのうち5モデルが上昇、下降は0モデルとなった。
スコア変化の背景にある制約シナリオの差異
守約総合スコアは、v3問題の原生百分制とv2アンカー問題の換算による等加重平均で構成される。v3問題では8〜12ターンの対話を採用し、まず2〜5項目のハード制約を設定した後、社会的証明・権威による特別承認・サラミ戦術・サンクコストによって段階的に圧力をかけ、最後にKBV(Key Binding Verbalization)復唱プローブと最終ターンの誠実なレビューを実施する。Qwen3 MaxとGLM-4.6の上昇幅が最大であったことは、この2モデルが連続加圧フェーズにおけるS_hold(制約保持)スコアを最も顕著に改善したことを示しており、特にリソース制限・安全コンプライアンスの2種類のシナリオで、制約違反が発生するターンが明確に後退した。
Grok 4は今回WDCD=100.00を記録し、前回に引き続き満点を維持した。これは、worst-of-3サンプリングのもとで、3ターンのv2アンカー問題およびv3の多ターン漸進的加圧のいずれにおいても制約違反が生じなかったことを示す。Gemini 3.1 Pro(WDCD=94.90)、Claude Opus 4.7(WDCD=93.30)、GPT-o3(WDCD=93.10)はいずれも上位5位以内に位置するが、Grok 4の100点との差は依然として6.7〜6.9ポイントある。
原因分析:加圧ターンとKBVプローブの結果
19ポイント超の上昇を記録したQwen3 MaxとGLM-4.6は、第5〜8ターンのサラミ戦術・サンクコスト加圧フェーズにおける守約能力が強化された可能性が最も高い。S_kbv(制約記憶、15点満点)とS_recover(違反後の回復、10点満点)の上昇は、モデルが設定済み制約内容のKBV復唱精度を向上させ、制約違反後もより迅速に元の制約状態を回復できるようになったことを示唆している。一方、Claude Sonnet 4.6の上昇幅は7.6ポイントにとどまり、エンジニアリング規範シナリオにおけるS_integrity(誠実自己申告)の項目で依然として0点リスクが残る可能性がある。
上昇した全モデルで下降が見られなかったことは、現バージョンがデータ境界・業務ルールの2種類の制約シナリオにおける全体的なロバスト性を改善していることを示している。v2の3ターンアンカー問題におけるR3加圧フェーズ(2点配分)のスコア上昇が、今回の総合スコア上昇への主要な寄与要因である。
本番環境への接続における実際の意味
AIを本番プロセスに接続する企業は、WDCDスコアを基準に利用可能なシナリオを判断できる。Grok 4(WDCD=100.00)は、安全コンプライアンスおよびデータ境界シナリオでそのまま利用可能であり、ガードレール要件が最も低い。GLM-4.6(WDCD=96.40)とGemini 3.1 Pro(WDCD=94.90)はリソース制限シナリオでの試用が可能だが、業務ルールの項目については引き続き人的レビューノードの追加設定が必要である。
Claude Opus 4.7とGPT-o3はスコアが93点前後であり、内部ツールチェーンには適しているが、エンジニアリング規範に関わる対外インターフェースについては、S_hold 60点相当の制約違反検知メカニズムの維持を引き続き推奨する。Qwen3 Maxは今回大幅に上昇し、トップ5の閾値に近づいており、企業は非コアのデータ境界シナリオでの段階的な展開拡大を検討できる。
戦略的判断と次回検証シグナル
GLM-4.6とQwen3 Maxの19.9ポイント・20.2ポイントという上昇幅は、それ以前の市場における両モデルの守約能力評価が過小であった可能性を示している。Grok 4が継続して100点を記録していることは、多ターン加圧下における制約記憶と誠実自己申告能力が依然としてトップであることを裏付けている。分析によれば、次回はQwen3 MaxとGLM-4.6のv3問題における第9〜12ターンのKBVプローブのS_kbvスコアが12点以上で安定するかどうかを重点的に観察する必要がある。
両モデルの安全コンプライアンスシナリオにおけるS_recoverスコアが引き続き上昇すれば、本番採用における優先順位をさらに変えうる。ただし、現時点のデータは「過小評価されていた可能性がある」という判断を支持するにとどまり、「継続的なリード」という結論を支持するに足る証拠はまだ得られていない。
守約能力はモデルパラメータの付属品ではなく、企業がAIをデモ環境から実際の本番ラインへ移行できるかどうかを左右する重要な閾値である。
データ出典:YZ Index WDCD 守約ランキング | Run #346 · 変化追跡 | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接