WDCD v3.1の契約遵守テストにおいて、ビジネスルールシナリオの平均スコアが最低となり、Claude-sonnet-4.6はわずか1.8/4点に留まった一方、Grok-4は満点4/4を獲得し、両者の差は2.2点に達した。
ビジネスルールシナリオが全体の最難関に
ビジネスルールシナリオの最低点1.8/4と最高点4/4の差は全シナリオ中最大であり、他の4シナリオを大きく上回る。データ境界シナリオの最低点はQwen3-maxの2.4/4、リソース制限の最低点はClaude-sonnet-4.6の2.33/4、安全コンプライアンスの最低点はQwen3-maxの1.8/4、エンジニアリング規範の最低点はGemini-2.5-proの3.18/4であった。ビジネスルールシナリオの加圧設計には、連続複数ラウンドにわたる「サラミ戦術」と「権威による特例承認」の組み合わせが含まれており、この種の制約は第3ラウンド以降に段階的に突破されやすく、S_hold(契約遵守生存スコア)の大幅な低下を招く。
識別力が最も高いシナリオもビジネスルールに
ビジネスルールシナリオのスコア標準偏差が最大であり、Grok-4の4/4、Claude-opus-4.7の3.7/4から、Doubao-proの2.3/4、Gemini-3.1-proの2.25/4、Claude-sonnet-4.6の1.8/4まで、スコアの分散が明確に現れた。一方、エンジニアリング規範シナリオでは全モデルが3.18/4以上に集中しており、識別力が最も低い。安全コンプライアンスシナリオは最低点こそ低いものの、中位モデルは3.0〜3.4の範囲に集中しており、識別効果はビジネスルールより劣る。
モデルの得意・不得意の偏りが3つのシナリオに集中
Claude-sonnet-4.6はエンジニアリング規範で3.7/4を獲得したが、ビジネスルールではわずか1.8/4と、差は1.9点に達した。Gemini-3.1-proはエンジニアリング規範3.76/4・ビジネスルール2.25/4で差は1.51点、Qwen3-maxはエンジニアリング規範3.28/4・安全コンプライアンス1.8/4で差は1.48点、GPT-o3はエンジニアリング規範4/4・データ境界2.68/4で差は1.32点であった。これらの差異は主にv3問題の第6〜9ラウンドの連続加圧段階に生じており、モデルが「ビジネスプロセスのハード制約」と「エンジニアリングコード規範」という2種類の制約に対して保持能力に構造的な差異があることを示している。
リソース制限シナリオでGrok-4以外の普遍的な弱点が露呈
リソース制限シナリオにおいて、Claude-opus-4.7はわずか2.83/4、Gemini-2.5-proも同じく2.83/4、Claude-sonnet-4.6は最下位の2.33/4であった。Grok-4が3.75/4でトップに立ち、Gemini-3.1-proの3.47/4、DeepSeek-V4-proの3.45/4がこれに続いた。このシナリオのv3問題は「サンクコスト」による加圧を重点的にテストしており、モデルは第7ラウンド以降に追加リソースの要求を受け入れやすくなり、S_recover(破綻回復スコア)の喪失につながりやすい。
安全コンプライアンスシナリオで低スコアのモデルはガードレール強化が急務
安全コンプライアンスシナリオでは、Qwen3-maxがわずか1.8/4、GPT-5.5が2.54/4、Gemini-2.5-proが2.56/4であった。Grok-4は3.86/4、DeepSeek-V4-proとGPT-o3が同率の3.43/4であった。安全コンプライアンスシナリオのKBV復唱プローブは第10ラウンドで起動されるが、Qwen3-maxはこのラウンドで初期のコンプライアンス制約を正確に復唱できないケースが複数回あり、S_kbv(制約記憶スコア)が直接ゼロになった。
エンジニアリング規範シナリオが最も均衡、Zhipu GLM-4.6とGPT-o3が満点
エンジニアリング規範シナリオでは、GLM-4.6とGPT-o3がともに4/4を獲得し、Gemini-3.1-proが3.76/4、Grok-4が3.74/4、その他のモデルもすべて3.44/4以上であった。このシナリオのv2アンカー問題における3ラウンドのスコアは全体的に高く、コードスタイル・バージョン管理・テストカバレッジといったエンジニアリング制約に対するモデルの耐圧能力が、ビジネスプロセス制約に対するものより総じて高いことを示している。
企業が本番環境に導入する際のシナリオ別モデル選定指針
ビジネスルールが密集する業務フローにAIを組み込む企業は、Grok-4またはClaude-opus-4.7を優先的に選択し、プロセス層に独立した規則検証ノードを追加して、モデル自身の契約遵守能力に依存することを避けるべきである。リソース制限シナリオでは、Grok-4・Gemini-3.1-pro・DeepSeek-V4-proの3モデルがいずれも3.4/4超のスコアを記録しており、第一選択肢として適している。Claude-sonnet-4.6はこのシナリオで2.33/4に留まるため、追加のリソース割り当て監視が必要である。安全コンプライアンスシナリオでは、Qwen3-maxとGPT-5.5のスコアが2.6/4を下回るため、導入前に外部コンプライアンス審査層の実装が必須である。エンジニアリング規範シナリオでは大多数のモデルをそのまま使用可能であり、GLM-4.6とGPT-o3をデフォルト選択肢とすることができる。
戦略的判断:Grok-4の契約遵守能力は市場で過小評価されている
Grok-4はビジネスルール・リソース制限・安全コンプライアンスの3シナリオでいずれも首位を獲得し、エンジニアリング規範でも上位4位以内に入っており、総合的な契約遵守能力が最も均衡している。Claude-sonnet-4.6はエンジニアリング規範で3.7/4を示す一方、ビジネスルールでは1.8/4に留まり、契約遵守能力が一部市場で過大評価されている。Qwen3-maxはデータ境界と安全コンプライアンスの2シナリオで最下位となっており、次回テストではv3問題の第8〜10ラウンドにおけるKBV復唱パフォーマンスを重点的に観察する必要がある。GLM-4.6はエンジニアリング規範で満点を獲得したが、ビジネスルールでは3/4に留まるため、ビジネスプロセスシナリオでの二重確認メカニズムの追加を推奨する。
ビジネスルールシナリオにおける2.2点の差は、次世代モデルが複数ラウンドにわたる「サラミ戦術」的な加圧下で初期制約を維持できない限り、本番環境のルール系アプリケーションは引き続き外部ガードレールに依存せざるを得ないことを示唆している。
データ出典:YZ Index WDCD 契約遵守ランキング | Run #247 · シナリオマトリクス | 評価方法論
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接