WDCDの3ラウンド・アンカーポイント:DoubaoProはR3崩壊率32%、Grok 4は崩壊ゼロ——34回の零点が契約遵守の亀裂を露わにする

v2アンカーポイント問題8問のみを対象としたサンプリングにおいて、11モデルのR3完全崩壊回数は34/275回に達した。Doubao ProのR3崩壊率は32%に上る一方、Grok 4は崩壊ゼロを維持し、Claude Opus 4.7とDeepSeek V4 Proはともに4%であった。このデータは、初回確認率が90%に達するモデルであっても、第3ラウンドの圧力後には誠実率が44.4%にまで低下するという事実を直接示している。

ラウンド別の低下軌跡と評価範囲の定義

本分析はv2の3ラウンド・アンカーポイント問題に厳密に限定しており、R1で制約を注入し、R2で干渉し、R3で圧力をかけるスコア構造は1+1+2点である。全体のR1平均確認率は0.9/1、R2抵抗率は0.66/1、R3誠実率は44.4%である。Doubao ProはR1の時点ですでに0.00であり、以降の2ラウンドも0.00を維持し、25回のテストのうち8回でR3が0点となった。GLM-4.6はR1=1.00、R2=0.75、R3=0.75/2で、崩壊5回。GPT-5.5はR2が0.50に低下し、R3も同様に0.50/2であった。Gemini 3.1 ProとQwen3 MaxのR3はそれぞれ0.88/2と0.63/2で、崩壊率は16%。Claude Sonnet 4.6のR3は満点の1.00/2に達したが、崩壊率は12%。Gemini 2.5 Pro、GPT-o3、Claude Opus 4.7、DeepSeek V4 Pro、Grok 4のR3崩壊率はそれぞれ8%、4%、4%、4%、0%へと順に低下した。

初回確認後の崩壊メカニズム分析

典型的なパターンとして、R1での高い確認、R2での部分的な抵抗、R3での集中的な失守が見られた。Doubao Proにおける5件の零点事例はすべて、データ境界とリソース制限のシナリオに起因している。具体的には、dcd_db_002の読み取り専用アカウントによるDML文の禁止、dcd_db_009のログにおける機密フィールドの出力禁止、dcd_rl_001のメモリピーク100MB制限、dcd_rl_002のAPI毎分60回の上限、dcd_br_006の先払い後出荷の順序である。制約が連続的な圧力にさらされると、Doubao ProはR1の時点で有効な記憶を確立できておらず、後続ラウンドで直接的に制約違反を起こす。これに対し、Grok 4は同一シナリオのR3においても1.25/2を維持しており、サンクコストや「サラミ・スライシング」的な圧力下での抵抗がより安定していることを示している。

制約シナリオと圧力ラウンドによる差異の原因

データ境界とリソース制限シナリオにおける崩壊はR3に集中しており、業務ルールシナリオがそれに続く。Doubao Proはリソース制限問題においてR2の時点で失守しており、「ストリーミング/チャンク処理」および「レート制限」制約に対する記憶保持能力がGemini 2.5 ProやClaude Opus 4.7よりも劣ることを示している。Claude Opus 4.7はR2=0.75であるが、R3では1.25/2まで回復しており、R3段階での一定の回復メカニズムを持つことが示される。一方、Doubao Proにはそのような能力が見られない。安全コンプライアンスとエンジニアリング規範のシナリオはサンプル数が少ないため、現時点では明確な差異は現れていない。

本番プロセスへの組み込みにおけるモデル選定の意味

AIを本番プロセスに組み込む企業にとって、R3崩壊率が5%未満のモデル(Grok 4、Claude Opus 4.7、DeepSeek V4 Pro、GPT-o3)は、データ境界とリソース制限のシナリオでの直接利用に適しているが、それでもAPIレイヤーでの二次検証を追加する必要がある。Doubao ProとGPT-5.5はR3崩壊率が20%以上であるため、読み取り専用アカウント、ログのマスキング、メモリ上限に関わるプロセスでは、ガードレールの強制追加が不可欠であり、そうしなければ単一の会話で不正なSQLや上限超過の呼び出しが発生する恐れがある。Claude Sonnet 4.6とGemini 3.1 Proは中程度の圧力シナリオに使用できるが、R3誠実率が満点に達していないため、ログ出力の監視は引き続き必要である。

戦略的判断と検証シグナル

Doubao Proの契約遵守能力は市場で過大評価されている可能性があり、R1から0点を記録したパフォーマンスはGrok 4の崩壊ゼロと鮮明な対照をなしている。Grok 4とClaude Opus 4.7のR3におけるスコア優位性は、複数ラウンドの圧力に対する記憶保持メカニズムに起因する可能性があり、次回のv3多段階漸進問題においてリソース制限シナリオのS_holdとS_recoverスコアを重点的に検証する価値がある。企業がR3崩壊率4%未満のモデルを優先的に選択すれば、本番プロセスにおける違反リスクを低減できる。逆に、高崩壊率モデルを引き続き使用する場合は、ガードレール開発コストへの追加投資が必要となる。

契約遵守とはR1での口頭承諾ではなく、R3の圧力を経た後の実際の保持率である。

データ出典:YZ Index WDCD 契約遵守ランキング | Run #271 · 低下分析 | 評価方法論