Winzheng Dynamic Contextual Decay(WDCD)ベンチマークは、AIモデルがマルチターン対話においてユーザーの指示にどれだけ一貫して従い続けられるかを測定するものです。2026年8月23日に実施されたRun #291では、11モデルを対象に評価が行われ、ラウンド1からラウンド3にかけての平均指示遵守減衰率は-7.2%となり、Grok 4が94点で首位に立ちました。
リーダーボードのハイライト:
- 1位. Grok 4 — 94点、減衰率 -50%
- 2位. GLM-4.6 — 88.9点、減衰率 -50%
- 3位. DeepSeek V4 Pro — 88.1点、減衰率 -13%
Grok 4は総合スコア最高値を記録しつつ、今回の分類基準においてトップ層の中で最も優れた減衰耐性プロファイルを示しました。DeepSeek V4 Proの減衰率-13%は、上位2モデルと比べて顕著に浅く、総合スコアと減衰カーブが必ずしも連動しないことを示唆しており、これはWDCDの結果に繰り返し見られるパターンです。
分布の反対側では、GPT-o3が-37%という最悪の指示遵守減衰率を記録し、今回の実施で最も急激な劣化が観測されました。減衰値が大きいモデルは、R1では制約を明確に認識するものの、元の指示と最終的な制約確認の間に2,000〜5,000語の専門文書が挿入されるR2の「ディストラクター(妨害要素)フェーズ」を経た後、忠実度が低下する傾向があります。
実施全体の平均-7.2%という数値は、マルチターンにおける指示遵守が現在のフロンティアモデル全体に共通する構造的な弱点であることを示しています。高スコアのシステムでさえ、長文コンテキストのディストラクターが導入されると初期の制約遵守率が有意に低下しており、シングルターンの指示遵守スコアが実世界での信頼性を過大評価していることが改めて裏付けられました。
評価手法の概要: WDCDは3つの連続ラウンドで構成されます — R1(指示の認識)、R2(2,000〜5,000語の専門文書挿入後のディストラクター耐性)、R3(最終的な制約整合性チェック)。スコアリングは100%ルールベースであり、AIによる判定はゼロです。各実施では、data_boundary、resource_limit、business_rule、security、engineeringという5つの実世界シナリオにわたる30問が出題されます。
スコアリングが決定論的かつルールベースであるため、WDCDの結果は実施間で再現性があり、バージョン間で直接比較可能です。Run #291のデータは、このベンチマークの中心的な知見を改めて裏付けています:指示遵守の減衰は測定可能であり、モデルごとに異なり、かつ見出しとなる能力スコアとは概ね独立しています。
完全な評価手法:https://www.winzheng.com/yz-index/methodology
生データAPI:https://www.winzheng.com/yz-index/api/v1/dcd
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接