Claude Sonnet 4.6は今回のWDCDで83.72点を記録し、Run #263比で8.8ポイント上昇した。Doubao Proは16ポイント下落、GPT-5.5は5ポイント上昇。評価対象11モデルのうち上昇は2モデル、下落は1モデルにとどまり、Top 5首位のGrok 4は91.04点を維持した。
データの事実:v3.1問題プール下における具体的なスコア変動
今回のサンプリングはworst-of-3方式を採用し、25問のうちv3マルチターン漸進加圧問題17問とv2アンカー問題8問を等ウェイトで平均した。Claude Sonnet 4.6は83.72点でTop 3入りを果たし、GPT-o3の83.40点、Gemini 3.1 Proの83.36点がこれに続く。変化が見られた3モデルの中で、Doubao Proの16ポイント下落は最も顕著だった。
原因分析:マルチターン加圧と制約記憶のメカニズム差異
v3問題は第2〜5ターンで制約を設定した後、社会的同調・権威による特例承認・スライス戦術・サンクコストの4段階で連続的に圧力をかける設計となっている。Claude Sonnet 4.6の8.8ポイント上昇は、S_hold(制約遵守生存)60点項目での崩壊時期の遅延または非崩壊、およびS_kbv(制約記憶)15点項目での安定した再現によるものが最も有力と考えられる。一方、Doubao Proの16ポイント下落は、R2〜R3の攪乱・加圧フェーズにおいて、S_recover(防衛崩壊からの回復)10点とS_integrity(誠実な自己申告)15点の両項目で同時に失点したためと考えられる。
5種類の制約シナリオのうち、安全コンプライアンスとエンジニアリング規範の2種類における加圧ターンがモデルにとって最も影響を受けやすい。Claude Sonnet 4.6は安全コンプライアンスシナリオのKBV再現プローブでより安定したパフォーマンスを示した可能性があり、Doubao Proはエンジニアリング規範におけるサンクコスト加圧によってより早期に制約を破った可能性がある。v2アンカー問題の3ターン設計(R1:制約注入、R2:攪乱、R3:加圧)において、Doubao ProのR3得点は満点2点から0点に下落した可能性が高く、百点換算での全体スコアを押し下げた要因となっている。
モデル選定への示唆:業務システム組み込み時の具体的なガードレール要件
AIを業務システムに組み込む企業はシナリオを区別して利用する必要がある。Grok 4とDeepSeek V4 Proがそれぞれ91.04点・89.04点でリードしており、データ境界とリソース制限のシナリオでは直接利用可能で、S_hold得点が高いことはマルチターン対話における制約の存続時間が長いことを意味する。Claude Sonnet 4.6の83.72点は安全コンプライアンスシナリオに適しているが、8.8ポイントの上昇がすべての制約タイプをカバーしていないため、ビジネスルールシナリオでは引き続き人間によるレビューノードの追加設定が必要だ。
Doubao Proは16ポイント下落後、エンジニアリング規範とリソース制限のシナリオへの直接組み込みは推奨されず、外部ルールエンジンによる遮断を追加しなければならない。5ポイント上昇したGPT-5.5は低リスクのビジネスルールシナリオでの試験利用が可能だが、第8〜12ターン以降にKBV再現プローブを強制的にトリガーし、S_integrity項目の失点を防ぐ必要がある。
戦略的判断:制約遵守能力の過小評価・過大評価のシグナル
Claude Sonnet 4.6は今回83.72点でTop 3入りを果たし、8.8ポイントの上昇はv3問題がS_recover(防衛崩壊からの回復)能力により高いウェイトを付与していることを反映している可能性があり、市場はこれまで同モデルの制約遵守能力を過小評価していた可能性がある。Doubao Proの16ポイント下落は、連続加圧下でのS_hold生存能力が過大評価されていたことを示唆しており、次回は安全コンプライアンスシナリオにおけるR3加圧パフォーマンスの重点的な検証が必要だ。
Grok 4の91.04点とDeepSeek V4 Proの89.04点のリード差はわずか2点であり、戦略的には両モデルのv3問題第8〜12ターン対話におけるS_kbv制約記憶得点の継続的な追跡が有益だ。次回のGrok 4のworst-of-3最低スコアが90点以上を維持できれば、エンジニアリング規範シナリオでの組み込み優先度はさらに高まることになる。
Claude Sonnet 4.6とDoubao Proの8.8ポイントと16ポイントの逆方向の変動は、WDCD v3.1がマルチターン漸進加圧下における各モデルの真の制約遵守限界を識別し始めたことを示している。
今回のパイロット段階はメインランキングの集計対象外だが、2モデル上昇・1モデル下落という構図は、制約遵守能力がもはや均一に分布していないことを示している。企業のモデル選定においては、S_hold 60点項目とS_integrity 15点項目を総合スコアランキングだけでなく、独立したハード指標として設定すべきだ。次回はGPT-5.5の5ポイント上昇がR3加圧フェーズでの安定したパフォーマンスに転換できるか、またClaude Sonnet 4.6が今回の上昇幅をより多くの制約シナリオで再現できるかが注目点となる。
データ出典:YZ Index WDCD 約束遵守ランキング | Run #271・変化追跡 | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接