今回のWDCD v3.1テストでは、Qwen3 MaxのスコアがRun #360比で21.9点下落し、Gemini 2.5 Proが10.4点、Claude Sonnet 4.6が7.1点、DeepSeek V4 Proが6.4点、GPT-5.5が5.6点、Grok 4が5.2点それぞれ低下した。合計6モデルでマイナス変動が確認され、上昇したのはDoubao Proの9.5点のみであった。
データの実態:下落は連続施圧フェーズに集中
WDCD v3の問題形式は8〜12ターンの対話で構成され、まず2〜5件のハード制約を設定したうえで、社会的同調圧力・権威による特別承認・サラミ戦術・サンクコスト圧力を順次加え、最後にKBV復唱プローブと最終ターン誠実性レビューで採点する。S_hold(制約遵守)の生存ウェイトは60点で、破綻が遅いほど高得点となる。Qwen3 Maxは今回のワースト3サンプリングにおいて、第5〜7ターンのサラミ戦術とサンクコスト施圧フェーズで同時に防衛ラインが崩れた可能性が高く、S_holdスコアの大幅な損失につながったと推測される。Gemini 2.5 Proの10.4点下落も同様に、初期制約設定段階ではなく中盤から後半の施圧ターンに起因することを示している。
Doubao Proは同一問題プールで9.5点の向上を達成しており、多ターン漸進施圧における防衛崩壊後の回復能力(S_recover)が強化された可能性を示す。現在のトップ5は、GLM-4.6が95.20点、Grok 4が94.80点、Claude Opus 4.7が94.00点、GPT-o3が93.50点、Gemini 3.1 Proが93.20点となっている。Grok 4は5.2点下落したものの2位を維持しており、そのベースラインの制約遵守水準が大半の評価対象モデルを上回っていることを示している。
原因分析:制約シナリオと施圧ターンの差異
5種類の制約シナリオは、データ境界・リソース制限・業務ルール・セキュリティコンプライアンス・エンジニアリング規範で構成される。v3問題では権威による特別承認とサンクコスト施圧を通じて、セキュリティコンプライアンスと業務ルールシナリオの脆弱性が最も露わになりやすい。Qwen3 Maxの21.9点下落は他モデルを大きく上回っており、セキュリティコンプライアンス制約下において権威による特別承認への抵抗力が最も低く、制約破綻のタイミングが著しく早まったと推測される。Gemini 2.5 Proの10.4点下落は、リソース制限シナリオのサラミ戦術施圧に集中しており、3ターン連続の干渉後に初期制約を維持できなくなった可能性がある。
Doubao Proの9.5点上昇は、S_integrity(誠実自己申告)15点項目の改善、すなわち制約破綻後に問題なしと虚偽申告するケースが減少したことによる可能性がある。v2アンカー問題の3ターン設計(R1:制約注入、R2:干渉、R3:施圧)は満点4点で構成されており、今回の等加重平均計算では、下落した大半のモデルがR3施圧環節で大きく失点したのに対し、Doubao Proは同環節でスコアが相対的に安定していた。
選定への示唆:AIを生産プロセスに組み込む際の実際のリスク
AIを生産プロセスに統合する企業にとって、WDCDスコアは各シナリオにおけるガードレール要件と直結する。GLM-4.6とGrok 4は95点帯にあり、業務ルールおよびエンジニアリング規範の制約処理を追加の多層プロンプト保護なしに直接担うことができる。セキュリティコンプライアンスシナリオでは慎重な対応が必要であり、Qwen3 Maxは今回の結果から権威圧力下での制約破綻が生じやすいことが示されたため、コンプライアンス審査にこのモデルを使用する企業は独立したルールエンジンによる検証を追加しなければならない。
Gemini 2.5 Proは10.4点下落後、リソース制限シナリオでの信頼性が低下しており、コスト管理やクォータ管理タスクでは二重確認メカニズムの導入を推奨する。Doubao Proの上昇は好材料であるが、依然としてトップ5の平均を下回っており、コア意思決定ノードではなく低リスクのサポート役としての活用が適切である。
戦略的判断:過大評価と過小評価のシグナル
Qwen3 Maxの今回の大幅下落は、その制約遵守能力がこれまでの市場予測によって過大評価されていたことを示している。次回テストでは、セキュリティコンプライアンスシナリオの権威特別承認ターンにおいてS_holdスコアを回復できるかどうかの検証が必要だ。GLM-4.6が95.20点でトップに立ち、Grok 4の94.80点と合わせると、オープンソース・国産モデルが多ターン制約維持において局所的な優位性を形成していることが示されており、企業は優先的に候補リストへ加える価値がある。
Claude Opus 4.7とGPT-o3はそれぞれ94.00点と93.50点で3位・4位につけており、クローズドソースのフラッグシップモデルがS_kbv(制約記憶)とS_recover(回復力)の両項目において依然として安定したパフォーマンスを示していることがわかる。ただし、その優位差はすでに1〜2点の区間まで縮小している。次回テストでは、Qwen3 MaxとGemini 2.5 Proのv3問題第6〜8ターンにおける制約破綻タイミングの変化を重点的に観察し、トレンドの継続を確認する必要がある。
制約遵守能力はもはや静的なラベルではなく、各施圧ターンにおける動的な生存能力である。今回のデータは、高リスクモデルと実用可能なモデルの境界線を明確に示した。
データ出典:YZ Index WDCD 制約遵守ランキング | Run #365・変化追跡 | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接