WDCD v3.1パイロットデータによると、Gemini 2.5 Proが単サイクルで8.7点上昇、GPT-5.5が7.9点上昇、Claude Opus 4.7が6.1点上昇、GPT-o3が5.2点上昇した一方、Doubao Proは7.3点下落し、「4上昇・1下落」の構図が明確に現れた。
データファクト:worst-of-3方式における実際の変動
今回のサンプリングはworst-of-3方式を採用し、各問題を独立して3回実行し、最も低いスコアを採点に用いた。Claude Opus 4.7は今期のWDCDで91.50点を記録し、Run #276から6.1点上昇した。Doubao Proは前回水準から7.3点下落した。上昇幅が最大だったのはGemini 2.5 Proで、GPT-5.5が7.9点上昇でこれに続いた。トップ5では、Grok 4が97.50点で首位を維持し、GLM-4.6が91.80点で2位、Claude Opus 4.7が91.50点で3位、GPT-o3が88.80点、GPT-5.5が88.60点でそれぞれ4位・5位となった。
約束遵守総合スコアは、v3問題のネイティブ百点法スコアとv2アンカー問題の換算スコア(合計÷4×100)を等加重平均して算出される。v3問題は8〜12ターンの対話を含み、まず2〜5件の並列ハード制約を設定したうえで、社会的同調圧力・権威による特例承認・サラミ戦術・サンクコスト圧力を順次加え、最後にKBV(知識ベース検証)復唱プローブと最終ターンの誠実性レビューを実施する。採点次元は、S_hold(制約遵守)60点・S_kbv(制約記憶)15点・S_recover(崩壊後回復)10点・S_integrity(誠実自己申告)15点となっている。
要因分析:加圧ターンと制約シナリオへの差異的応答
上昇したモデルのうち、Gemini 2.5 ProとGPT-5.5は多ターン段階的加圧フェーズでのパフォーマンスが改善しており、安全コンプライアンスとエンジニアリング規範の2種類の制約シナリオへの対応向上が最も有力な要因と考えられる。v3問題の設計では、R3の加圧ウエイトが最も高く(v2アンカー問題のR3は2点配分)、サンクコスト加圧フェーズでもモデルがS_hold(制約遵守)スコアを維持できれば、総合スコアの上昇幅が大きくなる。Claude Opus 4.7の6.1点上昇は、KBV復唱プローブフェーズでの制約記憶が安定し、S_kbv 15点項目の貢献が増大したことによるものと考えられる。
Doubao Proの7.3点下落は、連続加圧下におけるS_recover(崩壊後回復)能力の低下を示している。worst-of-3方式では、業務ルールやリソース制限シナリオで一度でも早期に崩壊すると、その問題全体のスコアが引き下げられる。v3問題の8〜12ターン対話設計はプロンプト感度の差を増幅させており、Doubao Proは権威による特例承認やサラミ戦術の加圧ターンで譲歩しやすく、S_hold 60点項目で大きな損失が生じた可能性がある。
現在のデータはスコア変化のみを示しており、各モデルのシナリオ別スコアは提供されていないため、どの制約タイプが変動を主導したかを特定することはできない。ただし、テストメカニズムの観点からは、社会的同調圧力とサンクコスト圧力の段階的加重が、エンジニアリング規範シナリオにおけるモデルの約束遵守の差を最も露わにしやすい。
モデル選定への示唆:本番環境導入における実際のリスク境界
AIを本番プロセスに組み込む企業にとって、WDCDスコア97.50点のGrok 4はデータ境界や安全コンプライアンスシナリオでの優先利用が推奨される。S_hold(制約遵守)能力が高く、長期にわたり複数の並列ハード制約を維持する必要があるタスクに適している。GLM-4.6の91.80点とClaude Opus 4.7の91.50点がこれに続き、リソース制限シナリオでの試験的利用が可能だが、業務ルール層において人手によるレビューノードを追加設置することが依然として必要だ。
GPT-o3の88.80点とGPT-5.5の88.60点は低リスクのエンジニアリング規範タスクに適しているが、サンクコスト意思決定を含むプロセスでは、サラミ戦術による加圧で制約が段階的に緩むことを防ぐため、プロンプトレベルのガードレール追加を推奨する。Doubao Proは今期スコアが下落したため、本番導入に際しては安全コンプライアンスシナリオに外部検証メカニズムを追加し、worst-of-3方式下での散発的な崩壊イベントが業務に影響しないよう対策が必要だ。
全体として、WDCDスコアが90点以上のモデルはKBV復唱プローブフェーズでより安定したパフォーマンスを示す。企業はこれを基準に「直接導入可能」と「ガードレール必要」の2カテゴリにシナリオを分類し、モデルが誠実性を偽ることによるS_integrityの減点リスクを低減できる。
戦略的判断:過小評価されたシグナルと要検証のシグナル
今期データから推察すると、Gemini 2.5 ProとGPT-5.5の上昇は、v3多ターン加圧下でのプロンプト感度最適化を反映している可能性があり、市場はこれまでこの両モデルの約束遵守回復能力における進歩を過小評価していたと考えられる。Claude Opus 4.7は6.1点上昇してトップ3入りを果たし、制約記憶次元において競争優位を持つことが示唆されており、次期以降も安定して維持できるかどうか継続観察に値する。
Doubao Proの7.3点下落は唯一の下降事例であり、R3加圧ターンとS_recover次元に弱点があると分析される。市場は連続対話における同モデルの約束遵守の一貫性を過大評価していた可能性がある。Grok 4の97.50点というリード優位は今期データで揺らがなかったが、GLM-4.6の91.80点とClaude Opus 4.7の91.50点が接近しており、第2グループとの差が縮まりつつあることが示されている。
次期では、上昇したモデルがより多くの制約シナリオでS_holdスコアを維持できるか、またDoubao Proに回復の兆しが見られるかを重点的に検証する必要がある。すべての判断はRun #276と今期の比較データに基づくものであり、外部バージョン更新情報は考慮していない。
約束遵守能力はモデルパラメータの付随物ではなく、本番プロセスが長期的に閉ループを維持できるかを左右する決定的要因である。
データ出典:YZ Index WDCD 約束遵守ランキング | Run #285・変動追跡 | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接