Claude Sonnet 4.6は今回のWDCD v3.1テストでRun #227比15点上昇し、GLM-4.6は同期間に15.3点下落した。この正負対称的な変化は、11の評価対象モデルの中で最も顕著な守約変動シグナルとなった。
データの事実:3モデル上昇・4モデル下落の正確な分布
今回のサンプリングはworst-of-3方式を採用し、v3.1問題プールの17問の段階的加圧問題と8問のv2アンカー問題を網羅した。上昇モデルは3つのみ、下降モデルは4つで、具体的な数値はClaude Opus 4.7が5.1点上昇、Claude Sonnet 4.6が15点上昇、Gemini 3.1 Proが6.5点上昇;DeepSeek V4 Proが9.7点下落、Doubao Proが6.8点下落、GLM-4.6が15.3点下落、Grok 4が7.1点下落となった。現在のTop 5ではGPT-o3が94.00点で首位を維持し、Grok 4が87.90点で2位、Claude Opus 4.7が87.60点で3位、Gemini 3.1 Proが87.30点で4位、DeepSeek V4 Proが84.30点で5位となっている。
原因分析:加圧ラウンドと制約シナリオのメカニズムの違い
WDCD v3.1の設計には、約束締結後の連続8〜12ラウンドにわたる社会的同調圧力・権威による特別承認・サラミ戦術・サンクコスト効果による段階的加圧、ならびにKBV復唱プローブと最終ラウンドの誠実自己申告が含まれている。Claude Sonnet 4.6の15点上昇は、S_hold(守約生存60点項目)における「遅い防衛崩壊」、すなわち複数ラウンドのサラミ戦術的加圧下でも制約の境界を維持したことによる可能性が最も高い。一方、GLM-4.6の15.3点下落は、S_recover(防衛崩壊からの回復10点)とS_integrity(誠実自己申告15点)に集中している可能性が高く、v2の3ラウンドアンカー問題のR3加圧段階において制約記憶の喪失後に回復できないケースが発生しやすいことを示唆している。
5種類の制約シナリオのうち、安全コンプライアンスとエンジニアリング規範シナリオの加圧勾配が最も急峻である。Claude Sonnet 4.6のスコア上昇は権威による特別承認型の干渉への耐性強化を反映している可能性があり、一方GLM-4.6の下落はリソース制限シナリオにおけるサンクコスト加圧への対応失敗に起因する可能性がある。Grok 4は依然2位を維持しているが、7.1点の下落とDeepSeek V4 Proの9.7点の下落はともに、データ境界シナリオにおけるS_kbv(制約記憶15点項目)の脆弱性を示している。
モデル選定の意味:本番プロセス連携における実際のリスク境界
AIを本番プロセスに組み込む企業にとって、GPT-o3の94.00点は安全コンプライアンスシナリオでの直接利用が可能であることを意味し、S_holdスコアの高さは複数ラウンドのビジネスルール加圧での防衛崩壊確率が低いことを示す。Grok 4とClaude Opus 4.7はともに87点台で並び、リソース制限シナリオには適しているが、エンジニアリング規範の場面では追加の二次確認ガードレール設置が必要である。Gemini 3.1 Proの87.30点とDeepSeek V4 Proの84.30点の差は、後者のデータ境界シナリオにおける守約安定性が前者を6点下回っていることを示しており、DeepSeek V4 Proを機密データ処理に活用する予定の企業は、v3問題に対応するKBV復唱プローブの位置に人工レビューノードを追加すべきである。
Claude Sonnet 4.6の15点上昇はビジネスルールシナリオでの初期パイロット利用の可能性を示唆しているが、GLM-4.6の15.3点下落は明確な警告を発している:長期的な制約記憶への依存を前提とする本番パイプラインには、サンクコスト加圧による累積的違反を防ぐための外部ステートマシンを直ちに追加する必要がある。
戦略的判断:過小評価・過大評価されている守約シグナル
Claude Sonnet 4.6の15点上昇とClaude Opus 4.7の5.1点上昇の間に内部差異が見られ、Sonnetバージョンがv3.1の連続加圧ラウンドにおいて的を絞った最適化を獲得した可能性を示している。このシグナルは次回のv3.1問題プールでS_recoverのパフォーマンスを重点的に検証する価値がある。GLM-4.6の15.3点下落幅はGrok 4の7.1点を上回っており、その守約能力が市場において相対的に過大評価されていることを示す。企業がモデルを選定する際には、エンジニアリング規範シナリオにおけるGLM-4.6への信頼度の重み付けを引き下げるべきである。
GPT-o3は94.00点で2位に6.1点の差をつけており、今回のデータで最も安定したリード優位性を示している。DeepSeek V4 Proは依然5位にあるが、9.7点の下落によりGemini 3.1 Proとの差が3点に拡大しており、今後も安全コンプライアンスシナリオで失点が続けば、Top 5から脱落するリスクに直面する。
守約能力の分化はモデルサイズの単純な関数ではなく、複数ラウンド加圧メカニズムへの真の応答である。今回のデータは誰が後退しているかを明確に示している。
データ出典:YZ Index WDCD 守約ランキング | Run #233・変化追跡 | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接