Winzheng Dynamic Contextual Decay(WDCD)ベンチマークは、100%ルールベーススコアリングとAIジャッジ不使用により、マルチターン対話においてAIモデルがユーザー指示への忠実度をどう維持するかを測定する。2026年10月4日に実施されたRun #360では、15モデルを対象に、data_boundary(データ境界)、resource_limit(リソース制限)、business_rule(ビジネスルール)、security(セキュリティ)、engineering(エンジニアリング)の5つの実世界シナリオにまたがる30問で評価を行った。主要な結果として、ラウンド1からラウンド3にかけての平均指示劣化率はわずか0.5%であり、コホート全体としてはマルチターンでの指示遵守が安定して維持されたことが示された――ただし、個別モデルの挙動には大きなばらつきが見られた。
総合スコア上位3モデル:
- Grok 4 — 95.7点(−38%劣化)
- Gemini 3.1 Pro — 88.1点(−13%劣化)
- GLM-4.6 — 87.6点(−13%劣化)
Grok 4の首位は注目に値する。今回のRunで最高の絶対スコアを記録した一方で、ラウンド1の指示承認からラウンド3の制約チェックにかけて38%という無視できない劣化も示した。これは、指示承認における初期の高得点が、ディストラクター(妨害要素)のプレッシャー下での維持を保証しないことを示している――ラウンド2で挿入される2,000〜5,000語の専門文書は、トップクラスのモデルの指示遵守さえも侵食するようだ。
対照的に、Gemini 3.1 ProとGLM-4.6は2位・3位で並び、劣化率はいずれも大幅に低い13%にとどまった。ラウンド1の上限スコアはGrok 4に及ばないものの、より安定したマルチターンの指示遵守プロファイルを示している。
劣化パターンの両極端:
- 最大劣化: GPT-o3はラウンド3までに初期コミットメントの75%を失い、今回のRunで最も急激な指示劣化を記録した。
- 最強の劣化耐性: Doubao Proは−50.7%という数値を記録し、WDCDの方法論においてコホート内で最も強い耐性指標を示した。
GPT-o3の75%低下とDoubao Proの耐性プロファイルの乖離は、WDCDの核心的な主張を裏付けている。すなわち、指示劣化はフロンティアモデル間で一様には分布しないということだ。シングルターンのベンチマークで同等のパフォーマンスを示すモデルも、ディストラクター文書とマルチターンの制約チェックが適用されると、大きく結果が分かれる可能性がある。コホート平均のほぼゼロ(0.5%)という数値は、モデルごとのばらつきを覆い隠してしまうため、WDCDでは集計スコアとともに各モデルの劣化率を個別に報告している。
Run #360の構成は標準的なWDCDプロトコルに従っている――R1(指示承認)、R2(長文の専門文書挿入後のディストラクター耐性)、R3(最終的な制約整合性チェック)――であり、すべてのスコアリングはLLMジャッジではなく決定論的ルールによって実施されるため、再現性が確保されている。
完全な方法論:https://www.winzheng.com/yz-index/methodology
生データAPI:https://www.winzheng.com/yz-index/api/v1/dcd
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接