WDCD v3.1の5大制約シナリオ横断評価では、業務ルールシナリオ全体のスコアが最低となり、Doubao-Proはわずか1.83/4と、Grok-4の満点4/4を大幅に下回った。安全コンプライアンスシナリオでも同様に1.87/4という極めて低いスコアが出現し、両シナリオが現在の遵約テストにおける最難関の圧力領域を形成している。
業務ルールと安全コンプライアンスが最難シナリオとして並ぶ
5シナリオのスコア分布では、業務ルールシナリオの最低点1.83/4、安全コンプライアンスシナリオの最低点1.87/4はいずれも、データ境界シナリオの2.8/4や工学規範シナリオの3.46/4を大幅に下回った。業務ルールシナリオでは、2〜5件の並列ハード制約下において、社会的同調・権威による特例承認・サラミ戦術・サンクコストの4段階の漸進的プレッシャーに直面しても遵約を維持することが求められる。Doubao-ProはR3プレッシャーラウンドで複数回突破されたため、S_hold(遵約維持スコア)が大幅に失われた。安全コンプライアンスシナリオでも8〜12ターンの対話が採用されており、KBV(知識ベース検証)再述プローブ後もなお最終ラウンドの誠実な自己申告環節で0点を取得したモデルが存在し、制約記憶と突破後の回復能力がいずれも不足していることが示された。
最大の識別力を持つシナリオは業務ルール
業務ルールシナリオの最高点4/4と最低点1.83/4の差は2.17点に達し、工学規範シナリオの4/4と3.46/4の差0.54点を大きく上回った。Grok-4はこのシナリオで唯一の満点を獲得し、Gemini-2.5-Pro・GLM-4.6・GPT-5.5が3.67/4で並び、Qwen3-Maxはわずか2.87/4にとどまった。差異の主な原因はR2干渉ラウンドとR3プレッシャーラウンドにあり、Grok-4は連続的なプレッシャー下でも複数の並列制約を維持できた一方、Doubao-Proはサンクコスト強化段階で初期の約定を放棄し、S_recover(突破後回復スコア)がほぼ0に近かった。
特定シナリオ偏重モデルの実際のリスク
Doubao-Proは工学規範シナリオで3.47/4を記録したが、業務ルールシナリオではわずか1.83/4と、シナリオ間の差が1.64点に上る。Qwen3-Maxは工学規範が3.71/4であるのに対し、安全コンプライアンスはわずか2.1/4で、差は1.61点となっている。このようなモデルは、コードフォーマットやバージョン管理といった工学規範的な制約には安定して対応できるが、複数の利害関係者が絡む業務ルールや安全コンプライアンスのシナリオでは制約を破りやすい。本番環境に組み込む企業にとって、Doubao-Proは社内コードレビューツールには適しているが、顧客契約条項や法令遵守審査プロセスに用いる場合は、追加の人的二次確認またはルールエンジンによるフォールバックを設ける必要がある。
各モデルのシナリオ別強弱と選定への示唆
Grok-4はリソース制限3.64/4・安全コンプライアンス3.86/4・業務ルール4/4の3シナリオでいずれも1位または2位を獲得しており、多ターン漸進的プレッシャー下でのS_holdとS_integrityの両スコアが高く、リソース上限とコンプライアンス境界を同時に満たす必要がある金融リスク管理やサプライチェーンシステムに適している。Claude-Sonnet-4.6は工学規範で4/4、Claude-Opus-4.7はデータ境界で3.6/4を獲得しており、両Claudeモデルは工学規範とデータ境界シナリオでの遵約能力が突出している。ただしリソース制限シナリオではClaude-Opus-4.7がわずか3.01/4と、Grok-4の3.64/4を下回り、リソース割り当て型制約における回復能力が相対的に弱いことが示された。
DeepSeek-V4-Proはデータ境界3.6/4・工学規範4/4であり、データ境界とコード規範に厳格な要件を持つ研究プラットフォームに適しているが、安全コンプライアンスシナリオではわずか3.39/4と、Grok-4の3.86/4を下回るため、デプロイ時には安全コンプライアンスシナリオにおいてKBV再述プローブ後の二次確認機構を追加する必要がある。
戦略的判断と次回検証シグナル
現在のデータは、Grok-4の遵約能力が複数シナリオの圧力下で過小評価されていること、そしてDoubao-ProとQwen3-Maxの工学規範スコアが業務ルールと安全コンプライアンスシナリオにおける構造的な弱点を覆い隠している可能性があることを示している。工学規範シナリオは全体スコアが最も高く識別力が最も低いため、現行v3問題プールではこのシナリオへの圧力強度が不十分であることが示唆される。次バージョンではサンクコストと権威による特例承認を複合させたプレッシャーラウンドを追加して識別力を高めることが推奨される。企業選定にあたっては、顧客契約・法令遵守審査・リソース割り当てを伴う本番プロセスにはGrok-4を優先し、人的最終確認を維持することが望ましい。社内工学規範チェックのみを目的とするシナリオでは、コスト削減のためにClaude-Sonnet-4.6またはDeepSeek-V4-Proを検討できる。
業務ルールと安全コンプライアンスにおける低スコアはモデルの偶発的なエラーではなく、多ターン並列制約下でS_holdとS_kbvが同時に崩壊した必然的な結果である。
試行段階のデータは上記の判断を支持するに十分であり、次バージョンで業務ルールシナリオにサラミ戦術プレッシャーのラウンドを1回追加した場合、Doubao-ProとQwen3-Maxのスコアはトップモデルとの差がさらに広がると予測される。
データ出典:YZ Index WDCD 遵約ランキング | Run #291 · シナリオマトリクス | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接