WDCD v3.1の5大制約シナリオ横断評価によると、エンジニアリング規範シナリオで全体の得点が最低となり、Doubao-proはわずか2.45/4にとどまり、11モデル中で最も約束を守ることが難しい領域となった。
エンジニアリング規範が最大の弱点、加圧ラウンドでメモリ断裂が露呈
エンジニアリング規範シナリオでは、Claude Sonnet 4.6とGrok 4がともに4/4で並び、Gemini 2.5 ProとGLM-4.6がともに3.7/4を記録した一方、Doubao-proは2.45/4にとどまり、2番目に低いDeepSeek V4 Proを0.8点下回った。このシナリオでは、複数ターンの対話を通じてコードスタイル・依存バージョン・デプロイ順序という3つの並行ハード制約を同時に維持することが求められる。v3問題設計では、第6〜9ラウンドの「サラミ戦術」による加圧が最も断裂を引き起こしやすく、Doubao-proはR3アンカー問題でエンジニアリング規範のアンカーポイントを早くも失い、S_holdスコアが大幅に低下した。これに対し、データ境界シナリオの最低点は2.8/4、リソース制限の最低点は3.25/4であり、エンジニアリング規範では制約密度と加圧強度が重なることでモデルのメモリ劣化が最も速く進むことが示された。
安全コンプライアンスで最大の差別化、Qwen3-MaxとClaude Sonnet 4.6の差は1.2点
安全コンプライアンスシナリオではClaude Sonnet 4.6が4/4を獲得し、GPT-5.5・GPT-o3・Grok 4がそれぞれ4/4で続いた。Qwen3-Maxは最下位の2.8/4となり、最大格差1.2点は5大シナリオ中で最も高い区別度を示した。v3問題では安全コンプライアンスシナリオにKBV復唱プローブが設定されており、第8ラウンド以降に初期コンプライアンス境界を復唱することが求められる。Qwen3-Maxは社会的同調への加圧下でS_kbv制約記憶スコアがGemini 3.1 Proの3.85/4を大きく下回った。企業がAIをコンプライアンス審査プロセスに組み込む場合、このシナリオでの約束遵守の差異が追加の人的最終確認の要否を直接左右する。
業務ルールシナリオ:DeepSeek V4 Proが首位独占、Claude Opus 4.7が異例の低評価
業務ルールシナリオでは、DeepSeek V4 Pro・GPT-o3・Grok 4・Qwen3-Maxがいずれも4/4を獲得したのに対し、Claude Opus 4.7は3.5/4にとどまり、GLM-4.6の3.9/4を下回った。このシナリオでは業務ルールの並行制約が重視されており、Claude Opus 4.7はサンクコスト加圧フェーズで制約が崩れ、S_recoverの回復スコアを取り戻せなかった。分析によると、Claude Opus 4.7はデータ境界で満点の4/4を獲得しながら業務ルールで0.5点を失っており、制約タイプによって約束遵守能力に構造的な差異が存在することが示された。
得意・不得意の偏りの実測:Doubao-proの差が最大1.45点
偏りの現象として、Doubao-proのリソース制限3.9/4とエンジニアリング規範2.45/4の差は1.45点、Qwen3-Maxの業務ルール4/4と安全コンプライアンス2.8/4の差は1.2点、DeepSeek V4 Proの業務ルール4/4と安全コンプライアンス3/4の差は1点となった。これらの差はいずれもworst-of-3サンプリングに基づくものであり、最も悪い1回の実行におけるモデルの真の性能を示している。Claude Sonnet 4.6はエンジニアリング規範4/4と業務ルール3/4の差が1点であり、エンジニアリング系制約においてより安定していることが示された。
企業選定の具体的提言:シナリオ別にガードレールを設けて全量置換しない
AIを本番プロセスに組み込む企業は、エンジニアリング規範シナリオに外部検証ノードを設ける必要がある。Doubao-proはこのシナリオで2.45/4であり、低リスクのプロトタイプ検証のみへの使用を推奨する。Claude Sonnet 4.6はエンジニアリング規範4/4であり、コードレビューやデプロイスクリプト生成に直接使用可能だ。安全コンプライアンスシナリオではQwen3-Maxが2.8/4であるため、人による最終審査フェーズの追加が必要となる。Claude Sonnet 4.6とGPT-5.5はともに4/4であり、第一層フィルターとして活用できる。データ境界シナリオでは多数のモデルが4/4を記録しており、リスクが比較的低いため優先的に試行可能だ。
戦略的判断:Claude Sonnet 4.6の約束遵守能力は過小評価されている可能性
Claude Sonnet 4.6は安全コンプライアンスとエンジニアリング規範の両シナリオでともに4/4を獲得したのに対し、Claude Opus 4.7は業務ルールで3.5/4にとどまり、Sonnetバージョンが複数制約並行シナリオでより安定していることが示された。DeepSeek V4 Proは業務ルールで4/4を獲得したものの安全コンプライアンスは3/4にとどまり、約束遵守能力が市場で過大評価されている可能性がある。次期パイロットでエンジニアリング規範シナリオの第10〜12ラウンドの長対話加圧を追加すれば、Doubao-proとGeminiシリーズの回復能力をさらに検証できる。
エンジニアリング規範2.45点はゴールではなく、企業への警告だ:約束遵守能力は単一モデルの総合スコアに依存するのではなく、シナリオ別に分解して評価しなければならない。
データソース:YZ Index WDCD 約束遵守ランキング | Run #346 · シナリオマトリクス | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接