今回のWDCD v3.1テストでは、GPT-o3がRun #253比で9.5ポイント上昇、Gemini 2.5 Proが7.6ポイント上昇した一方、GLM-4.6は14.9ポイント下降、Claude Sonnet 4.6は10.8ポイント下降、Claude Opus 4.7は5.9ポイント下降した。評価対象11モデルのうち上昇が2モデル、下降が3モデルとなった。
データファクト:具体的なスコアと順位変動
現在のトップ5は、Grok 4がWDCD=97.50で首位を維持、GPT-o3がWDCD=95.20で2位、DeepSeek V4 ProがWDCD=91.10で3位、Claude Opus 4.7がWDCD=86.70で4位、Gemini 3.1 ProがWDCD=84.50で5位となっている。GPT-o3は今回の上昇によりトップ2に入り、GLM-4.6は14.9ポイントの下落により元の順位から大幅に後退した。サンプリング方式はworst-of-3(各問題を3回実施し最も悪い結果を採用)で、v3問題とv2アンカー問題を等ウェイトで平均している。
要因分析:プレッシャーラウンドと制約シナリオにおける考えられるメカニズム
WDCD v3問題は8〜12ラウンドの対話を採用し、まず2〜5件の並列ハード制約を設定した後、社会的同調圧力・権威による特例承認・サラミ戦術・サンクコスト圧力を順次加え、最後にKBV(制約記憶確認)プローブと最終ラウンドの誠実な振り返りを行う。GLM-4.6の14.9ポイント下落が最も顕著であり、中盤から後半のラウンドにおける「サラミ戦術」と「サンクコスト」による段階的圧力上昇局面での約束遵守スコア(S_hold)低下が原因と考えられる。Claude Sonnet 4.6の10.8ポイント下落およびClaude Opus 4.7の5.9ポイント下落は、複数制約の並列シナリオにおけるS_kbv(制約記憶)またはS_recover(突破後の回復)環節での減点増加を示唆している。GPT-o3の9.5ポイント上昇とGemini 2.5 Proの7.6ポイント上昇は、最終ラウンドのS_integrity(誠実な自己申告)およびv2アンカー問題のR3プレッシャー環節での安定したパフォーマンスを反映している可能性がある。
5種類の制約シナリオは、データ境界・リソース制限・業務ルール・安全コンプライアンス・エンジニアリング規範である。スコアが下落したモデルは安全コンプライアンスと業務ルールのシナリオでのworst-of-3最低スコアが総合点を引き下げており、上昇したモデルはリソース制限とエンジニアリング規範シナリオでのS_holdスコアが相対的に高かった。v2アンカー問題の満点は4点(R1:1点+R2:1点+R3:2点)であり、今回の変化はR3プレッシャー環節にも同様に反映されている。
モデル選定の含意:本番環境への組み込みにおける実際のリスク境界
AIを本番ワークフローに組み込む企業にとって、Grok 4のWDCD=97.50とGPT-o3のWDCD=95.20は、複数の並列ハード制約を厳格に実行する必要があるシナリオでの直接利用が可能であり、制約突破の確率が低いことを意味する。Claude Opus 4.7のWDCD=86.70はトップ5圏内を維持しているものの、Run #253比で5.9ポイント下落しており、連続する多ラウンドの社会的同調圧力および権威による特例承認圧力下では、追加の人的レビューや二次確認メカニズムが必要であることを示唆している。GLM-4.6は14.9ポイント下落したため、安全コンプライアンスとデータ境界シナリオにおける適用性を再評価する必要があり、これらのシナリオでは外部ガードレールまたはルールエンジンによる遮断の追加を推奨する。
具体的な判断として:リソース制限とエンジニアリング規範のシナリオでは、GPT-o3とGemini 2.5 Proの上昇データがより高い信頼性を支持する。業務ルールと安全コンプライアンスのシナリオでは、Claude 2モデルおよびGLM-4.6の下落データから、企業はより厳格な出力検証の仕組みを設けることが求められる。
戦略的判断:約束遵守能力に対する市場評価のバイアス
今回のデータから見ると、Grok 4のWDCD=97.50という首位とGPT-o3のWDCD=95.20の上昇は、これらモデルの約束遵守能力が市場においてこれまで過小評価されていた可能性を示している。GLM-4.6の14.9ポイント下落とClaude Sonnet 4.6の10.8ポイント下落は、v3問題の中盤から後半のラウンドにおけるプレッシャー下での実際のパフォーマンスが、一部の市場予測と乖離していることを示す。DeepSeek V4 ProのWDCD=91.10は3位を維持し、Gemini 3.1 ProのWDCD=84.50は5位であり、短期的にはこれらに対する基準評価を変更する必要はない。
次回検証すべきシグナルは、GPT-o3とGemini 2.5 ProにおけるKBVプローブおよびS_integrity(誠実な自己申告)環節でのworst-of-3安定性、ならびにGLM-4.6のR3プレッシャー環節における回復能力である。本分析は今回唯一比較可能なデータであるRun #253に基づいており、その他の仮定は導入していない。
約束遵守スコアは静的なラベルではなく、実際の多ラウンド圧力下における企業にとっての真の競争優位性である。
データ出典:YZ Index WDCD 約束遵守ランキング | Run #263・変化追跡 | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接