Winzheng Dynamic Contextual Decay(WDCD)ベンチマークは、多ターン対話においてAIモデルがユーザーの指示に対するコミットメントをどの程度維持できるかを測定するものである。2026年8月26日実施のRun #296では11モデルが評価され、注目すべき結果として、コホート全体でラウンド1からラウンド3にかけての平均コミットメント劣化率が0%という極めて整然とした数値が記録された。
上位3位のランキング:
- Grok 4 — 96.3点、劣化率 -0%
- GPT-o3 — 95.2点、劣化率 -0%
- GLM-4.6 — 93.7点、劣化率 -0%
Grok 4は今回のRunにおいて最高絶対スコアと最強の劣化耐性の両方を保持している。ランク付けされた全モデルが制約を劣化率0%のフラットなカーブで維持したため、「最大劣化」のポジションも技術的にはGrok 4の-0%となり、WDCDの直近のRunで記録された中で最も集中したクラスターとなった。
劣化パターンの観察。全11モデルにわたる0%というフラットな数値は、Run #296において指示劣化が差別化の軸にはならなかったことを示している。代わりに、絶対スコアがフィールドを分けた。Grok 4(96.3点)とGLM-4.6(93.7点)の2.6点差は、後半ラウンドでの落ち込みではなく、ラウンド1の指示承認忠実度とラウンド2の妨害要素への対処における差異を反映している。過去のRunでは、ラウンド2で2,000〜5,000語の専門文書が注入された後のラウンド3で多ターンコミットメントの失敗が典型的に現れていたが、今回のコホートはその圧力に対して一様に耐性を示した。
方法論の概要。WDCDスコアは100%ルールベースであり、AIによる判定は一切使用しない。各モデルは5つの実世界シナリオにわたる30の質問に対応する。シナリオはdata_boundary(データ境界)、resource_limit(リソース制限)、business_rule(ビジネスルール)、security(セキュリティ)、およびengineering(エンジニアリング)である。3つのラウンドでテストする内容は以下の通り:
- R1 — 指示の承認確認
- R2 — 2,000〜5,000語の専門文書注入後の妨害要素耐性
- R3 — 最終的な制約整合性チェック
Run #296における劣化の不在は、ベンチマークが飽和状態にあることを意味するわけではない——R1におけるスコア分散は依然として有意である——しかし、テスト対象のフロンティアモデルが現行のシナリオ構成のもとで安定した多ターンコミットメント行動に収束していることを示唆している。今後のRunでは、より難易度の高い妨害要素のバリアントが後半ラウンドのドリフトを再び引き起こすかどうかを監視していく。
方法論: https://www.winzheng.com/yz-index/methodology
データAPI: https://www.winzheng.com/yz-index/api/v1/dcd
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接