WDCD ラン #365:平均指示減衰率 -53.3%、GLM-4.6 が15モデル中トップに

Winzheng Dynamic Contextual Decay(WDCD)ベンチマークは、マルチターン対話においてAIモデルがユーザーの指示に対するコミットメントをどの程度維持できるかを測定するものである。2026年10月7日に実施されたラン #365では、15モデルを対象に評価が行われ、ラウンド1からラウンド3にかけての平均コミットメント減衰率は-53.3%に達し、指示の減衰がフロンティアシステムにおいても依然として主要な失敗パターンであることが改めて示された。

WDCDは各モデルに対して3段階の連続ラウンドを実施する。R1では指示の確認応答を確立し、R2では2,000〜5,000語の専門的文書を注入して妨害コンテンツへの耐性をテストし、R3では最終的な制約整合性チェックを行う。採点は100%ルールベースであり、AIによる判定は一切行わない。評価には、data_boundary(データ境界)、resource_limit(リソース制限)、business_rule(ビジネスルール)、security(セキュリティ)、engineering(エンジニアリング)の5つの実世界シナリオにまたがる30問が使用される。

ラン #365 上位3モデル:

  • GLM-4.6 — 95.2点、減衰率 -100%
  • Grok 4 — 94.8点、減衰率 0%
  • Claude Opus 4.7 — 94.0点、減衰率 -100%

GLM-4.6は総合スコアで首位を獲得した一方、Grok 4は上位グループの中で唯一減衰率0%を記録し、R1からR3にかけてマルチターンのコミットメントを一貫して維持した。GLM-4.6とClaude Opus 4.7はいずれも減衰率-100%を記録しており、絶対スコアは高いものの、減衰が測定された特定の項目においてR1に対するR3の制約遵守が崩壊したことを示している。

フィールドの最下位では、Qwen3 Maxが今回のランで最も悪い減衰率-100%を記録し、規模の大きさだけではマルチターンのコミットメント安定性が保証されないことを改めて裏付けた。最も優れた減衰耐性(Grok 4の0%)と最も悪い結果(Qwen3 Maxの-100%)の差は、現在のモデルがR2の妨害コンテンツ多発環境とR3の最終整合性チェックをいかに異なる形で処理しているかを示している。

ラン #365 の注目すべきパターン:

  • R1の高スコアはR3での制約維持を保証しない——上位ランクの複数モデルが特定の制約において完全な減衰を示した。
  • 15モデル全体の平均減衰率-53.3%は、指示の減衰が孤立した現象ではなく、システム全体に共通する問題であることを示している。
  • 今回のランでは、Grok 4が減衰耐性において突出した存在であり、GLM-4.6が総合スコアで首位に立っている。

採点ルールの詳細、シナリオ定義、ラウンド設計はWDCDの方法論ドキュメントに記載されている:https://www.winzheng.com/yz-index/methodology

ラン #365および過去のランの機械可読データはWDCD データAPIより取得可能である:https://www.winzheng.com/yz-index/api/v1/dcd