WDCD Run #346:全11モデルが指示崩壊ゼロを達成、Grok 4が100点でリーダーボード首位

Winzheng Dynamic Contextual Decay(WDCD)ベンチマークは、大規模言語モデルが複数ターンの対話においてユーザーの指示をどの程度確実に保持できるかを測定するものです。2026年9月30日付けのRun #346では、評価対象の全11モデルがラウンド1からラウンド3にかけて平均コミットメント崩壊率0%を記録し、これはリーダーボード史上最もフラットな崩壊曲線となりました。

上位3位の結果 — WDCD Run #346:

  • Grok 4 — 100.0点(崩壊率:-0%)
  • GLM-4.6 — 96.4点(崩壊率:-0%)
  • Gemini 3.1 Pro — 94.9点(崩壊率:-0%)

Grok 4は絶対スコアランキングおよび崩壊耐性ランキングの両方でトップに立ち、今回のRunで唯一満点の100点を達成したモデルとなりました。GLM-4.6とGemini 3.1 Proはそれぞれ3.6点、5.1点差で続いていますが、Grok 4と同様にゼロ崩壊の挙動を示しています。つまり、このスコア差は後続ターンにおける指示の劣化によるものではなく、ラウンド1での指示承認品質の違いに起因しています。

崩壊パターンの考察:全11モデルで平均崩壊率0%という結果は注目に値します。従来のWDCDランでは、2000〜5000語の専門的なディストラクター文書——作業コンテキストから既存の制約を排除するよう設計されたもの——にモデルがさらされるラウンド2以降で、測定可能な劣化が観測されてきました。しかしRun #346では、テストしたいずれのモデルもR1とR3の間で指示崩壊の正味の発生を示しませんでした。これは、ディストラクターセットに対して一様に耐性を示したか、あるいは現世代のフロンティアモデルがWDCDプロトコル下で、より強固なマルチターンコミットメントの挙動に収束したことを示唆しています。

手法の概要:WDCDは3つの連続ラウンドを実施します。R1では指示の承認を確認し、R2では長い専門文書提示後のディストラクター耐性を確認し、R3では最終的な制約整合性チェックを行います。スコアリングはAIジャッジを一切使用しない100%ルールベースで行われます。評価は5つの実世界シナリオにわたる30問をカバーしており、シナリオはdata_boundary、resource_limit、business_rule、security、engineeringの5種類です。

崩壊率はR1とR3のスコア差として算出されるため、0%という数値は、R1で制約を正しく承認したモデルが、R2で導入されたディストラクター負荷の下でもR3を通じて制約を遵守し続けたことを示しています。ただし、全モデルが同一のベースラインから出発したことを意味するわけではなく、1位と3位の間にある5.1点の差は、保持率ではなく初期の制約取り込み精度の違いを反映しています。

完全なプロトコルドキュメント:https://www.winzheng.com/yz-index/methodology

機械可読の結果:https://www.winzheng.com/yz-index/api/v1/dcd