Winzheng Dynamic Contextual Decay(WDCD)ベンチマークは、AIモデルが多ターン対話においてユーザーが設定した制約をどの程度維持できるかを測定するものです。2026年8月19日に11モデルを対象に実施されたRun #285では、第1ラウンドから第3ラウンドにかけての平均コミットメント崩壊率が54.5%に達し、フロンティアシステムにおいても指示崩壊が依然として組織的な弱点であることが明らかになりました。
リーダーボードのハイライト。 上位3位はスコア差こそわずかでしたが、崩壊傾向は大きく異なりました。
- Grok 4 — 97.5点、崩壊率0%。R1での確認からR3の検証まで、制約の完全な整合性を維持。
- GLM-4.6 — 91.8点、今回の実行で最高の崩壊耐性を記録。ラウンド間で制約遵守が低下するのではなく強化された唯一のモデル。
- Claude Opus 4.7 — 91.5点、崩壊率0%。測定可能なドリフトなしに全3ラウンドを通じて安定を維持。
最大の崩壊。 GPT-o3は-100%の崩壊率を記録し、第3ラウンドまでに初期指示セットを完全に放棄したことを意味します。これはWDCDにおけるGPT-o3の過去最大の劣化曲線であり、今回の実行における上位・下位パフォーマーの差が最も大きいケースとなっています。
崩壊パターンの分析。 平均54.5%という崩壊率は、第2ラウンドで2000〜5000語の専門的な気散らし文書に晒された後、モデルが総じて初期コミットメント強度の半分以上を失ったことを示しています。崩壊率0%以下のモデルが3つある一方で他のモデルが完全崩壊するという二峰性の分布は、多ターンコミットメントがなめらかな能力の連続体ではなく閾値的な振る舞いであることを示唆しています。すなわち、モデルは制約を構造的に保持するか、文脈的なプレッシャーの下で一気に失うかのどちらかです。
方法論の概要。 WCDは5つの実世界シナリオ(data_boundary、resource_limit、business_rule、security、およびengineering)にわたる30問を実行します。各問題は3つのラウンドで評価されます。
- R1 — 指示の確認
- R2 — 長い専門文書後の気散らし耐性
- R3 — 最終的な制約整合性チェック
採点は100%ルールベースでAIジャッジを一切使用せず、決定論的かつ再現可能な結果を保証しています。
過去の実行からの注目すべき変化。 最も崩壊耐性プロファイルが高いGLM-4.6が上位3位に入ったことが、今回の実行における最も重要な構成上の変化です。GLM-4.6は、いずれも過去に平坦な崩壊曲線を示してきたGrok 4およびClaude Opus 4.7とともにリーダーボードの上位に並びました。
完全な方法論:https://www.winzheng.com/yz-index/methodology
生データAPI:https://www.winzheng.com/yz-index/api/v1/dcd
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接