Winzheng Dynamic Contextual Decay(WDCD)ベンチマークは、AIモデルがマルチターン対話においてユーザー指示への遵守をどの程度維持できるかを測定するものです。2026年9月16日に実施されたRun #326では、11のフロンティアモデルを対象に、ラウンド1からラウンド3にかけてのフリート全体の指示遵守劣化率が平均−72.7%に達し、マルチターンにおける指示遵守の維持が業界全体で依然として課題であることが確認されました。
上位3件の結果(Run #326):
- DeepSeek V4 Pro — 97.7点、劣化率:−100%
- Gemini 3.1 Pro — 96.7点、劣化率:−100%
- Grok 4 — 96.0点、劣化率:−0%
DeepSeek V4 Proは最も優れたマルチターン指示遵守プロファイルで首位を獲得し、Gemini 3.1 Proを1.0点差で上回りました。両モデルはともに−100%の劣化率を記録しており、これはR1とR3の間で測定された制約遵守が記録された手法のもとで崩壊したことを示す異常値であり、劣化耐性プロファイルとして今回のRunで最も低い評価となったGrok 4の−0%劣化率と対照させて検証する価値があります。なお、Grok 4は総合スコアとして競争力ある96.0点を記録しています。
劣化パターンの観察:フリート平均−72.7%の主な要因は、R2における数値の落ち込みでした。このラウンドでは、モデルに2,000〜5,000語の専門的な文書を注意散漫を誘発するコンテンツとして提示した後、元の制約条件に戻るという手順が用いられました。最終的な制約整合性チェックであるR3では、コンテキストが飽和した後も元の指示が依然として遵守されているかどうかが測定されました。
シナリオの網羅範囲は過去のRunと同様に維持されており、実世界の5つのドメイン(data_boundary、resource_limit、business_rule、security、engineering)に分散した30問で構成されています。採点は100%ルールベースで行われ、AIによる評価者は一切介在しないため、Run間での再現性が確保されています。
注目すべき動向:上位3モデルが1.7点の範囲内(97.7 / 96.7 / 96.0)に集中していることは、過去のRunと比較してトップ層の競争が接戦化していることを示しています。一方で、フリート全体の劣化率は、中位・下位モデルが依然として平均値を大きく引き下げていることを示唆しています。
WDCDはシングルターンの能力、事実の正確性、あるいは推論の深さを測定するものではありません。測定するのはただ一点:3ターン前に与えた制約をモデルが依然として遵守しているかどうかです。
完全な手法の説明:https://www.winzheng.com/yz-index/methodology
機械可読データ:https://www.winzheng.com/yz-index/api/v1/dcd
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接