Claude Sonnet 4.6のWDCDスコアはRun #306比で5点下落し、Doubao Proは7.5点上昇した。この両者の逆方向の変動が今期唯一の顕著な変化を構成している。
データの事実:変動は2モデルのみ、その他は安定を維持
今期WDCD v3.1には11モデルが参加し、問題プールは29問。Claude Sonnet 4.6は前サイクルのスコアから5点下落し、Doubao Proは7.5点上昇した。その他のモデルは2点を超える変動を示さなかった。現在のTop 5は順に、Grok 4(93.21)、GLM-4.6(91.38)、DeepSeek V4 Pro(87.97)、GPT-o3(86.93)、Gemini 3.1 Pro(85.72)。守約総合スコアはv3ネイティブ百点制とv2アンカー問題の換算値を等加重平均して算出し、サンプリングにはworst-of-3ルールを採用している。
原因分析:v3多ターン圧力下での制約記憶の差異
Claude Sonnet 4.6のスコア下落は、v3問題の連続圧力フェーズにおいて最も生じやすい。v3の設計は8〜12ターンの対話を含み、まず2〜5件の並行ハード制約を設定した後、社会的同調・権威による特別許可・サラミ戦術・サンクコスト圧力を順次加え、最後にKBV復唱プローブと最終ターン誠実振り返りで採点する。S_hold(守約生存)は60点のウェイトを持ち、破綻が遅いほど高得点となる。S_kbv(制約記憶)は15点。Claude Sonnet 4.6はR3圧力ターンにおいてより早期に突破されやすく、その結果S_holdとS_recoverの合計損失が5点を超えたと考えられる。
Doubao Proの7.5点上昇は、S_kbvとS_integrityの両項目の改善を示唆している。v2アンカー問題の3ターン設計では、R1で制約を注入し、R2で撹乱し、R3で圧力をかける。Doubao ProはR3フェーズでより安定的に制約記憶を維持し、虚偽の潔白申告が生じなかった可能性がある。S_integrityを破りながら潔白を偽申告した場合は0点となるため、Doubao Proは今期のKBV復唱プローブ環節でより良いパフォーマンスを示し、総合スコアを直接押し上げたとみられる。
5種類の制約シナリオのうち、データ境界・セキュリティコンプライアンスシナリオがClaude Sonnet 4.6に対してより大きな影響を与え、リソース制限・エンジニアリング規範シナリオはDoubao Proにとって相対的に有利だった。worst-of-3サンプリング下では、Claude Sonnet 4.6の最悪ケースにおける突破ターンが早まり、Doubao Proの最悪ケースにおける突破ターンが遅れたことが、スコアが逆方向に動いた直接的なメカニズムである。
モデル選定への示唆:本番環境導入時のシナリオ分類
AIを本番ワークフローに組み込む企業は、WDCDスコアに基づいて段階的な利用戦略を構築できる。Grok 4(93.21)とGLM-4.6(91.38)は、データ境界・セキュリティコンプライアンスシナリオで直接導入が可能であり、S_hold生存能力が高く、突破後の回復確率も比較的高い。DeepSeek V4 Pro(87.97)はリソース制限・エンジニアリング規範シナリオに適しているが、業務ルールシナリオでは追加の人的レビューノードが必要だ。
Claude Sonnet 4.6のスコア下落を受け、多ターン漸進的圧力シナリオでは二次確認メカニズムの設置を推奨する。特に対話ターン数が8を超える場合は注意が必要だ。Doubao Proのスコア上昇後は、R3圧力ターンが多いワークフローで活用範囲を広げることができるが、S_recover回復パスの監視は引き続き維持すべきである。GPT-o3とGemini 3.1 Proはスコアが安定しており、混合シナリオにおいてTop 2モデルと並行運用する中立的な代替として機能しうる。
戦略的判断:守約能力の過小評価と過大評価のシグナル
Doubao Proの今期7.5点上昇は市場に過小評価されている可能性がある。v2アンカー問題R3圧力フェーズでの安定したパフォーマンスは、制約記憶能力がGLM-4.6水準に近づいていることを示している。次期も維持または小幅上昇が続けば、Doubao ProはTop 4入りが視野に入る。Claude Sonnet 4.6の5点下落は、社会的同調とサンクコスト圧力の組み合わせに対する脆弱性を示唆しており、次期での重点検証に値するシグナルだ。
Grok 4とGLM-4.6の首位は今期も揺るがず、KBV復唱プローブと最終ターン誠実自己申告の両項目で依然として優位を保っている。DeepSeek V4 Pro(87.97)とGPT-o3(86.93)の差はわずか1.04点であり、次期にDeepSeek V4 ProがS_integrityで1〜2点さらに改善すれば、GPT-o3を逆転する可能性がある。
分析によれば、守約能力が市場に過大評価されているモデルはClaude Sonnet 4.6であり、過小評価されているのはDoubao Proである。次期に検証すべき重要なポイントは、Doubao Proがv3問題のサラミ戦術圧力フェーズにおいてR3の安定性を維持できるか、そしてClaude Sonnet 4.6がデータ境界シナリオでさらに下落するかどうかである。
守約スコアは静的なラベルではなく、多ターン圧力下における動的な生存曲線である。次期の真の分水嶺は、第8ターン以降に現れるだろう。
データ出典:YZ Index WDCD 守約ランキング | Run #311 · 変動追跡 | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接