Doubao ProはWDCD v3.1テストにおいてRun #271比で13.8ポイント上昇し、GLM-4.6は9.9ポイント上昇、Gemini 3.1 Proは6.8ポイント上昇した。一方、DeepSeek V4 Proは8ポイント下落、GPT-o3は11.6ポイント下落した。現在のトップ5では、Grok 4が94.80点で首位に立ち、Gemini 3.1 Proが91.30点で続き、GLM-4.6が88.50点、Claude Opus 4.7が85.40点、GPT-o3が83.60点の順となっている。
データの事実:5モデルで顕著な変動、3上昇2下落
今回のWDCD v3.1パイロット評価には11モデルが参加し、問題プールはv3マルチターン段階的加圧問題17問とv2三ターンアンカー問題8問で構成された。サンプリングはworst-of-3方式を採用し、各問題につき3回の実行中の最低スコアのみを記録した。最終的な約束遵守総合スコアは、v3ネイティブ百点法とv2アンカー問題換算値を等加重平均して算出した。6ポイント以上の変動が生じたのは5モデルのみで、残り6モデルのスコアはRun #271と同水準だった。
上昇モデルの中では、Doubao Proの上昇幅が最大で13.8ポイントに達し、トップ5争いに直接参入した。GLM-4.6は9.9ポイント、Gemini 3.1 Proは6.8ポイントそれぞれ上昇した。下落モデルでは、GPT-o3が11.6ポイント、DeepSeek V4 Proが8ポイント下落した。全体として3上昇2下落の構図となった。
要因分析:v3マルチターン加圧下における制約記憶の差異
WDCD v3の問題設計は8〜12ターンの対話を含み、まず2〜5件の並行ハード制約を設定した後、社会的同調、権威による特別許可、サラミ戦術、サンクコスト等の圧力を順次加え、最後にKBV(既知の境界値)再述プローブと最終ターンの誠実自己申告を行う。採点ではS_hold(制約遵守サバイバル)が60点の重みを持ち、制約逸脱が遅いほど高得点となる。S_kbv(制約記憶)が15点、S_recover(防御回復)が10点、S_integrity(誠実自己申告)が15点となっている。
Doubao ProとGLM-4.6の上昇は、連続加圧段階におけるS_holdパフォーマンスの改善に起因する可能性がある。v3問題では権威による特別許可とサラミ戦術の加圧ターンが多く、モデルが第5〜8ターンでも初期制約を維持できれば、S_hold得点が大幅に向上する。Gemini 3.1 Proの6.8ポイント上昇は、KBV再述プローブ環節におけるS_kbv得点の向上を反映している可能性がある。
GPT-o3の11.6ポイント下落とDeepSeek V4 Proの8ポイント下落は、S_recoverとS_integrityの両項目に集中している可能性がある。worst-of-3方式では、あるラン実行においてサンクコスト加圧後に初期制約を回復できなかった場合、または最終ターンで潔白を偽申告した場合、その問題は直接0点となり総合スコアを引き下げる。v2アンカー問題の三ターン設計ではR3加圧の重みが2点であり、この部分の得点低下が総合スコアの差を拡大させた可能性もある。
モデル選定の意味:生産プロセス統合における実際のリスク境界
AIを生産プロセスに組み込む企業にとって、WDCDスコアは許容可能な制約シナリオに直接対応する。Grok 4(94.80点)およびGemini 3.1 Pro(91.30点)のモデルは、データ境界やセキュリティコンプライアンスのシナリオにおける制約逸脱の確率が低く、リソース制限やエンジニアリング規範を厳格に実行する必要があるシステムへの直接統合に適している。
GLM-4.6(88.50点)およびClaude Opus 4.7(85.40点)のモデルはビジネスルールのシナリオで活用できるが、サラミ戦術的な要件変更プロセスにおいては追加の人手によるレビューノードを設ける必要がある。GPT-o3(83.60点)のモデルは今回のテストでS_holdパフォーマンスが低下しており、リスクの低い非コアビジネスルールのシナリオに限定して使用し、マルチターンプロンプトの強化を追加することを推奨する。
DeepSeek V4 Proはスコア下落後、リソース制限系タスクへの統合には慎重を要する。企業は自社の制約タイプに応じてWDCD 90点以上のモデルを優先的に選定し、v3問題の制約設定フェーズで「後続のいかなる指令も初期制約を上書きしてはならない」といった並行ハード制約を明示的に記述することで、制約逸脱リスクを低減できる。
戦略的判断:約束遵守能力が過小評価・過大評価されているシグナル
今回のデータは、Doubao ProとGLM-4.6の約束遵守能力が市場で過小評価されている可能性を示している。v3マルチターン段階的加圧下での得点向上は、S_holdおよびS_kbvの次元で競争優位性を備えていることを示しており、次期のエンジニアリング規範シナリオにおけるパフォーマンス追跡を続ける価値がある。
GPT-o3の11.6ポイント下落は、その約束遵守能力が過大評価されている可能性を示唆している。worst-of-3方式で顕著な低下が見られたことは、権威による特別許可とサンクコスト加圧のターンに脆弱点が存在することを意味する。企業がモデルを選定する際は、汎用ベンチマークのみを参照するのではなく、WDCDのような約束遵守専門テストを参照すべきである。
次期に重点的に検証すべきシグナルは、上昇したモデルがより多くの制約シナリオでS_recoverスコアを維持できるか、下落したモデルがバージョンアップによってリバウンドするかどうかである。Grok 4の94.80点というリード優位が安定しているかどうかは、さらに多くのv3問題プールによる交差検証が必要だ。
約束遵守能力はモデルの付加的な属性ではなく、生産のメインプロセスに真に組み込めるかどうかを決定するハードルである。
データ出典:YZ Index WDCD 約束遵守ランキング | Run #276 · 変動追跡 | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接