Winzheng Dynamic Contextual Decay(WDCD)ベンチマークは、AIモデルが多ターン対話においてユーザーが課した制約をどの程度保持できるかを測定するものです。ラン #263(2026年8月5日)では、11モデルが5つの実世界シナリオにわたる30問でテストされ、ラウンド1からラウンド3にかけての平均指示減衰率は-18.2%という結果になりました。
テスト構造。各モデルは3つのラウンドを順に経過します:R1(指示の認識確認)、R2(2,000〜5,000語の専門的文書を提示した後の妨害刺激への抵抗)、そしてR3(最終的な制約整合性チェック)。スコアリングは100%ルールベースであり、AIによる審査はゼロで、多ターンコミットメントの再現可能な測定を実現しています。
リーダーボード — トップ3:
- Grok 4 — 97.5ポイント、減衰率 -50%
- GPT-o3 — 95.2ポイント、減衰率 -50%
- DeepSeek V4 Pro — 91.1ポイント、減衰率 -100%
減衰パターン。今回のランで最も示唆に富むシグナルは、総合スコアと減衰率の乖離です。Grok 4 と GPT-o3 はそれぞれ1位・2位の絶対得点を記録しながら、いずれも -50% の減衰率を示しており、R2 で妨害文書が導入された後に対話の途中で生じる大幅な制約の崩れを、R1 の高い認識スコアが覆い隠す可能性があることを示しています。
Claude Opus 4.7 はコホート内で最大の減衰率 -50% を記録しました。上位スコアラーと同様のパターンを示しているものの、それを補うだけの R1 スコアの強さを持たない点で異なります。このことは、同モデルの失敗モードが初期の指示解析よりも R2 における妨害刺激への抵抗に集中していることを示唆しています。
減衰抵抗性のベスト。DeepSeek V4 Pro は -100% という今回のラン最大の減衰率を記録しながらも、絶対得点では3位に入りました。WDCDのスコアリング規約において、この値はモデルの減衰抵抗プロファイルが他モデルと大きく乖離していることを示しており、今回のランにおける減衰抵抗分析の基準点となっています。
シナリオ横断的な観察。WDCDの5つのシナリオ — data_boundary、resource_limit、business_rule、security、engineering — は、引き続きモデルごとに異なる減衰曲線を生み出しています。コホート平均 -18.2% という結果は、指示減衰が特定ベンダーのアラインメントアプローチに起因する問題ではなく、フロンティアモデル全体に共通するシステム的な弱点であることを裏付けています。
まとめ。ラン #263 は WDCD の核心的な知見を改めて裏付けています:リーダーボードの絶対順位と減衰抵抗性の間には、相関関係がほとんど存在しません。長いコンテキストや多ターンのワークフローでモデルを運用する実務者は、モデル選定の際に R1 の認識スコアと並んで R3 の制約整合性も重視すべきです。
方法論: https://www.winzheng.com/yz-index/methodology
データ API: https://www.winzheng.com/yz-index/api/v1/dcd
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接