WDCD ラン #263:Grok 4 が97.5ポイントで首位、平均指示減衰率は -18.2% に
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第263回では、11モデルを対象に多ターン対話における指示保持能力を測定した結果、平均指示減衰率は -18.2% となり、Grok 4 が97.5ポイントで首位を獲得した。
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第263回では、11モデルを対象に多ターン対話における指示保持能力を測定した結果、平均指示減衰率は -18.2% となり、Grok 4 が97.5ポイントで首位を獲得した。
WinzhengのWDCDベンチマーク第253回実行において、Grok 4が94.8点で首位を獲得。11モデルを対象とした評価では、平均指示コミットメント減衰率は4.5%となった。
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #247では、11モデルを対象に多ターン対話における指示遵守の減衰を測定し、平均指示減衰率は-1.8%を記録。上位モデルは減衰どころか指示遵
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #242において、Grok 4とGLM-4.6が指示劣化率0%でトップを維持する一方、Gemini 3.1 Proは-100%という最悪の結
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #233において、GPT-o3が94点・崩壊率0%で首位を獲得。一方、Gemini 3.1 Proは-100%という最悪の崩壊スコアを記録し
WinzhengのWDCDベンチマークRun #227において、11の最先端モデルを対象に測定した結果、Grok 4とDeepSeek V4 Proが91.4点で同率首位を獲得した。全モデルの平均指示遵守減衰率は-2.8%だったが、モデルご
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #221において、11モデルの平均命令遵守崩壊率が-36.4%に達した。Grok 4が95点でトップとなる一方、命令崩壊がトップクラスのシス
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #211では、11モデルを評価した結果、Grok 4が最高スコアかつ最小劣化率で首位を獲得。一方、GPT-o3はトップ3入りしながらも最大の
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #207では、11モデルを対象に複数ターン対話における指示遵守の崩壊を測定した結果、平均崩壊率は-66.3%に達した。Grok 4が満点10
WinzhengのWDCDベンチマークRun #202において、評価対象となった11のAIモデルの平均指示減衰率が-73.2%に達した。Gemini 3.1 Proが総合トップとなり、GPT-o3が最も安定した多ターン対話での指示遵守能力を
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #196において、評価対象11モデルの平均指示崩壊率が-39.9%に達した。Qwen3 Maxが総合首位を維持したものの、-90%という急激
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #185では、11モデルを対象に評価を実施した結果、ラウンド1からラウンド3にかけての平均コミットメント減衰率が-57.5%に達し、長文対話
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #171では、11モデルを対象に評価した結果、ラウンド1からラウンド3にかけての平均指示崩壊率が-37.9%となった。Qwen3 Maxが最
Winzhengの動的コンテキスト減衰(WDCD)ベンチマークRun #169において、11モデルの平均指示減衰率は4.5%となり、Grok 4が74.2ポイントでトップを獲得した。一方、GPT-o3は-75%という最大の指示減衰を記録した
大規模言語モデルは制約を「受け入れる」ことは得意だが、「維持する」ことは苦手であることが明らかになった。Winzhengの最新ベンチマーク「WDCD Run #164」では、11のフロンティアモデルが初回ラウンドで95.8%の制約遵守率を示
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #164において、11のAIモデルを評価した結果、第1ラウンドから第3ラウンドにかけて平均-44.3%の指示減衰が記録された。高い絶対スコア
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #161では、11モデルを対象に評価を実施した結果、Round 1からRound 3にかけての平均コミットメント減衰率が-48.6%となった
Winzheng動的コンテキスト劣化(WDCD)ベンチマークのRun #157では、11モデルの平均コミットメント劣化率が47.7%に達し、Claude Sonnet 4.6、Gemini 2.5 Pro、Qwen3 Maxの3モデルが67
WinzhengのWDCDベンチマーク Run #146では、11のAIモデルを評価し、平均命令減衰率24.7%を記録。Claude Opus 4.7、GPT-5.5、GPT-o3が70点で首位タイとなった一方、Doubao Proが減衰率
Winzheng動的文脈減衰(WDCD)ベンチマークのRun #140では、Qwen3 Maxが70.8点・減衰-17%で首位を獲得し、11モデル平均の指示減衰率は36.5%に達した。マルチターン対話における制約維持能力が、現行フロンティア