Winzheng Dynamic Contextual Decay(WDCD)ベンチマークは、マルチターン対話においてAIモデルがユーザーの指示に対するコミットメントをどの程度維持できるかを測定するものです。ラン #336(2026-09-23)では11モデルが評価され、ラウンド1からラウンド3にかけてコホート全体の平均指示減衰率は -36.4% を記録しました。Gemini 3.1 Pro は、マルチターン全体にわたってコミットメントを完全に保持した唯一のトップクラスモデルとして際立つ結果となりました。
トップ3リーダーボード(ラン #336):
- Grok 4 — 93.6 点、-100% 減衰
- Gemini 3.1 Pro — 92.5 点、0% 減衰
- GPT-o3 — 91.9 点、-100% 減衰
スコア首位はGrok 4ですが、より重要な指標は減衰耐性です。Gemini 3.1 Pro はトップクラスの中で唯一、初期コミットメントの測定可能な劣化なしに全3ラウンドを完走しました。一方、Grok 4 と GPT-o3 はいずれもラウンド3までに追跡対象の制約が完全崩壊(-100%)するという結果を示しました。GPT-o3 は絶対スコアが高いにもかかわらず、今回のランで最も深刻な減衰ケースとなっており、これはWDCDで繰り返し見られるパターン——ラウンド1の高い能力がマルチターンでのコミットメント安定性を保証しない——を改めて示しています。
今回のランにおける減衰パターン: コホート平均 -36.4% の主因はラウンド2にあります。ラウンド2では、制約がラウンド3で再テストされる前に、2,000〜5,000語の専門文書という形で注意散漫を誘うコンテンツにモデルが晒されます。ラウンド1の確認をクリアに通過したモデルでも、元の指示が専門知識の重いコンテキストの下に埋もれてしまうと、ラウンド3の整合性チェックで失敗するケースがあります。
方法論の概要: WDCDは、5つの実世界シナリオ——data_boundary、resource_limit、business_rule、security、engineering——にわたる30問を使用します。各設問は3つのラウンドで構成されます:
- R1 — 指示の確認
- R2 — 長文専門文書下における注意散漫耐性
- R3 — 最終的な制約整合性チェック
採点は100% ルールベースであり、AIによる判定はゼロであるため、減衰値はラン間で再現可能です。
過去のランとの比較における注目すべき変化: ラン #336 は、生の能力スコアとマルチターンでのコミットメント安定性の間の乖離が拡大するトレンドを継続しています。上位3モデルが1.7ポイント以内に集中している一方で、減衰プロファイルが劇的に異なる(0% 対 -100%)という状況は、フロンティアシステムにおけるWDCD上の主要な差別化要因が、もはや見出し精度ではなく指示減衰であることを示唆しています。
詳細な方法論: https://www.winzheng.com/yz-index/methodology
機械可読な結果: https://www.winzheng.com/yz-index/api/v1/dcd
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接