WDCD Run #242:Grok 4とGLM-4.6が指示劣化ゼロを維持、Gemini 3.1 Proは-100%で完全崩壊

Winzheng Dynamic Contextual Decay(WDCD)ベンチマークは、複数ターンの対話においてAIモデルがユーザーの指示をどの程度維持できるかを測定するものです。Run #242(2026年7月22日)では11モデルが評価され、ラウンド1からラウンド3にかけての全体平均指示劣化率18.2%に達し、完全に維持したモデルと完全に崩壊したモデルとの間で顕著な二極化が生じました。

上位3位のランキング:

  • Grok 4 — 93.8点、劣化率0%
  • GLM-4.6 — 92.0点、劣化率0%
  • DeepSeek V4 Pro — 90.9点、今回のRunにおける最良の劣化耐性プロファイルを記録

分布の反対側では、Gemini 3.1 Pro劣化率-100%という今回のRunにおける最悪の結果を記録しました。これはラウンド3までにラウンド1の制約遵守が完全に失われたことを示しており、Run #242の全体平均18.2%と比較して、単一モデルとして観測された中で最も急激な崩壊です。

劣化パターン。3ラウンド構成のプロトコルは、複数ターンにわたる指示維持がどこで破綻するかを特定します。R1では初期指示の認識を、R2では2,000〜5,000語の専門的な妨害文書を挿入してコンテキストの優先順位付けにストレスをかけ、R3では最終的な制約整合性チェックを行います。Run #242では、上位モデルはR2の妨害ペイロードを吸収してもR1の制約を一切失わなかった一方、最下位モデルはR3にいかなる制約も持ち越すことができませんでした。

スコアリングの信頼性。WCDはAIジャッジを一切使用しない100%ルールベースのスコアリングを採用しています。30問の問題セットは、data_boundary(データ境界)、resource_limit(リソース制限)、business_rule(ビジネスルール)、security(セキュリティ)、engineering(エンジニアリング)という5つの実世界シナリオファミリーにまたがっています。検証が決定論的であるため、劣化数値は文体的判断ではなく測定可能なルール違反を反映しています。

今回のRunにおける注目すべき観察:

  • 上位層(劣化率0%)と最下位(-100%)の差がRun #242の最大の特徴であり、劣化はコホート全体で緩やかに進行するのではなく、極端に二極化しています。
  • 上位3モデルは2.9点の幅(90.9〜93.8点)に集中しており、フロンティアモデルの生スコアはすでに競争的な水準に達しており、劣化耐性が主要な差別化要因となっています。
  • 平均劣化率18.2%は、R2で長文の妨害コンテキストが導入された際に、コホートの相当数のモデルが依然として指示遵守を失うことを示しています。

完全な方法論、スコアリングルーブリック、およびシナリオ定義:https://www.winzheng.com/yz-index/methodology

Run #242および過去のRunの構造化データエンドポイント:https://www.winzheng.com/yz-index/api/v1/dcd