Winzheng Dynamic Contextual Decay(WDCD)ベンチマークは、AIモデルがユーザーの課した制約を3ラウンドの対話を通じてどれほど厳密に維持できるかを測定するもので、スコアリングは100%ルールベースで行われ、AIによる評価は一切使用しない。Run #331は2026年9月20日に11モデルを対象に実施され、コホート全体でラウンド1(指示の確認)からラウンド3(最終的な制約整合性チェック)にかけて平均指示減衰率が-15.1%という結果となった。
上位3位のランキング(Run #331):
- Grok 4 — 91.8点、減衰率 -25%
- Gemini 3.1 Pro — 89.6点、減衰率 -38%
- GPT-o3 — 87.9点、減衰率 -14.8%
Grok 4は絶対スコアで首位を確保したものの、-25%のコミットメント減衰率は、ラウンド2の妨害フェーズ後に一定の劣化が生じていることを示している。ラウンド2では、最終制約チェックの前に2,000〜5,000語の専門文書がモデルに提示される。Gemini 3.1 Proは絶対スコアで2位に入ったが、上位3モデル中で最も急激な減衰率-38%を記録しており、ラウンド1での高い確認品質がマルチターンのコミットメント安定性の弱さを覆い隠している可能性を示唆している。
GPT-o3は今回のランク入りモデルの中で最も小さい減衰率-14.8%を記録した。ただし本データセットの報告スキームにおいては、この値が最大の減衰基準点としても位置づけられており、減衰の大きさと最終スコアは単独ではなく、併せて読み取る必要があることを改めて示している。
減衰スペクトラムの反対側に位置するDoubao Proは、プラットフォームの正規化減衰耐性指標において-79.4%という今回最強の減衰耐性を示した。絶対スコアで上位3位に入らなかったものの、制約保持の分析において注目すべきケースとして評価されている。
シナリオの範囲。30問のセットは、現実世界の制約カテゴリ5種類——data_boundary(データ境界)、resource_limit(リソース制限)、business_rule(ビジネスルール)、security(セキュリティ)、engineering(エンジニアリング)——にわたる。各ラウンドでは決定論的なルールチェックが適用されるため、減衰率の数値は主観的な判断ではなく、測定可能なルール違反を反映している。
Run #331のパターンに関する注記。コホート平均減衰率-15.1%という結果は、長文コンテキストの妨害下での指示の劣化が、現在のフロンティアモデル全般に共通する構造的な課題であることを裏付けている。最終スコアのランク順は減衰耐性と必ずしも一致しない——この乖離は、GPT-o3の低い減衰率と、より高い絶対スコアを持つGemini 3.1 Proの-38%という数値の対比に明確に表れている。
方法論: https://www.winzheng.com/yz-index/methodology
データAPI: https://www.winzheng.com/yz-index/api/v1/dcd
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接