WDCD ラン #271:Grok 4 が首位、平均指示減衰率は0.9%まで低下

Winzheng動的コンテキスト減衰(WDCD)ベンチマークは、複数ターンの対話においてAIモデルがユーザー指示へのコミットメントをどれほど確実に維持できるかを測定するものです。ラン #271(2026年8月9日)では11モデルが評価され、ラウンド1からラウンド3にかけてのグループ全体の平均指示減衰率はわずか0.9%を記録し、これまでに計測された中で最も小さい値の一つとなりました。

上位3位の結果

  • Grok 4 — 91点(減衰率:−25%)
  • DeepSeek V4 Pro — 89点(減衰率:−50%)
  • Claude Sonnet 4.6 — 83.7点(減衰率:0%)

Grok 4は絶対スコアで首位を獲得しましたが、今回のランで最も注目すべきパターンは、生スコアと減衰耐性の乖離です。Claude Sonnet 4.6は上位3位の中で唯一減衰率0%を記録し、総合3位にもかかわらずR1からR3にかけて制約の完全な整合性を維持しました。DeepSeek V4 Proは総合2位でしたが、減衰率−50%を記録しており、R1における高い指示受諾スコアがR3での制約維持の弱さを部分的に相殺したことを示しています。

分布の反対側では、GPT-5.5が今回のランで最も悪い減衰率−50%を記録し、DeepSeek V4 Proと同じ減衰幅ながら低いベーススコアからの低下となりました。これは、減衰率のパーセンテージだけでは順位に直結しないことを改めて示しています。減衰耐性が最良のモデルと最悪のモデルの差は、単一ターンの指示追従能力が同等に見える場合でも、複数ターンにわたるコミットメントが現在のフロンティアシステム間で依然として不均一な能力であることを浮き彫りにしています。

方法論の概要。WDCDは各モデルを3つのラウンドにわたってスコアリングします:

  • R1 — 指示の受諾確認
  • R2 — 2,000〜5,000語の専門文書に続く注意散漫要素への耐性
  • R3 — 最終的な制約整合性チェック

このベンチマークは5つの実世界シナリオにわたる30問を使用します:データ境界(data_boundary)、リソース制限(resource_limit)、ビジネスルール(business_rule)、セキュリティ(security)、エンジニアリング(engineering)。スコアリングはAIによる評価を一切排除した100%ルールベースで行われ、結果が主観的評価ではなく確定的な制約チェックを反映することを保証しています。

ラン #271における平均減衰率0.9%という狭い値は、集団レベルでのターン間安定性の全体的な改善を示唆していますが、DeepSeek V4 ProとGPT-5.5の双方における−50%の外れ値は、特定の失敗パターン——特にR2における長文書による注意散漫条件下——が依然として存在することを示しています。今後の実行では、集団レベルでの収束が継続するか、あるいは今回の実行に特有のシナリオ重み付けを反映したものかどうかを追跡していく予定です。

完全な方法論: https://www.winzheng.com/yz-index/methodology
データAPI: https://www.winzheng.com/yz-index/api/v1/dcd