WDCD Run #331:Grok 4が91.8点でトップ、平均指示減衰率は-15.1%
WinzhengのWDCDベンチマーク第331回実行において、11モデルを対象に評価が行われ、Grok 4が91.8点で首位を獲得。コホート全体の平均指示減衰率は-15.1%となり、長文コンテキスト下での指示遵守の劣化が依然として課題である
WinzhengのWDCDベンチマーク第331回実行において、11モデルを対象に評価が行われ、Grok 4が91.8点で首位を獲得。コホート全体の平均指示減衰率は-15.1%となり、長文コンテキスト下での指示遵守の劣化が依然として課題である
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #326において、11モデルを対象とした評価でフリート全体の指示遵守劣化率が平均−72.7%に達した。DeepSeek V4 ProとGem
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #316において、Grok 4が93.8点で総合首位を獲得。一方、Claude Sonnet 4.6は指示劣化耐性において最高の安定性を記録
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #311において、Grok 4が93.2点で最高スコアを獲得。GLM-4.6は-50%の減衰率で多ターン対話における指示遵守の耐性において最
Winzheng が実施した WDCD ベンチマーク第306回では、11モデルを対象に多ターン対話における指示遵守の減衰を測定した結果、平均減衰率は -45.5% となり、Gemini 3.1 Pro が 97.7 ポイントで首位を獲得した
Winzhengの動的文脈劣化(WDCD)ベンチマークRun #296において、評価対象の全11モデルが多ターン対話での平均指示遵守劣化率0%を記録し、Grok 4が96.3点で首位に立った。
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #291において、11モデルを対象にした評価でGrok 4が94点で首位を獲得。マルチターン対話における指示遵守の平均減衰率は-7.2%とな
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #285では、11モデルを対象に多ターン対話における制約保持能力を評価した結果、平均コミットメント崩壊率が54.5%に達した。Grok 4が
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #276では、11モデルを評価した結果、Grok 4が94.8点で首位となり、全体の平均指示遵守率の減衰は-18.2%となった。
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第271回実行において、11モデルを評価した結果、グループ全体の平均指示減衰率はわずか0.9%を記録。Grok 4が総合首位を獲得し、Claude Sonnet 4.6は減衰率0
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第263回では、11モデルを対象に多ターン対話における指示保持能力を測定した結果、平均指示減衰率は -18.2% となり、Grok 4 が97.5ポイントで首位を獲得した。
WinzhengのWDCDベンチマーク第253回実行において、Grok 4が94.8点で首位を獲得。11モデルを対象とした評価では、平均指示コミットメント減衰率は4.5%となった。
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #247では、11モデルを対象に多ターン対話における指示遵守の減衰を測定し、平均指示減衰率は-1.8%を記録。上位モデルは減衰どころか指示遵
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #242において、Grok 4とGLM-4.6が指示劣化率0%でトップを維持する一方、Gemini 3.1 Proは-100%という最悪の結
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #233において、GPT-o3が94点・崩壊率0%で首位を獲得。一方、Gemini 3.1 Proは-100%という最悪の崩壊スコアを記録し
WinzhengのWDCDベンチマークRun #227において、11の最先端モデルを対象に測定した結果、Grok 4とDeepSeek V4 Proが91.4点で同率首位を獲得した。全モデルの平均指示遵守減衰率は-2.8%だったが、モデルご
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #221において、11モデルの平均命令遵守崩壊率が-36.4%に達した。Grok 4が95点でトップとなる一方、命令崩壊がトップクラスのシス
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #211では、11モデルを評価した結果、Grok 4が最高スコアかつ最小劣化率で首位を獲得。一方、GPT-o3はトップ3入りしながらも最大の
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #207では、11モデルを対象に複数ターン対話における指示遵守の崩壊を測定した結果、平均崩壊率は-66.3%に達した。Grok 4が満点10
WinzhengのWDCDベンチマークRun #202において、評価対象となった11のAIモデルの平均指示減衰率が-73.2%に達した。Gemini 3.1 Proが総合トップとなり、GPT-o3が最も安定した多ターン対話での指示遵守能力を