WDCD Run #291:Grok 4が94点でトップ、マルチターン指示遵守の平均減衰率は-7.2%
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #291において、11モデルを対象にした評価でGrok 4が94点で首位を獲得。マルチターン対話における指示遵守の平均減衰率は-7.2%とな
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #291において、11モデルを対象にした評価でGrok 4が94点で首位を獲得。マルチターン対話における指示遵守の平均減衰率は-7.2%とな
WDCD v3.1パイロット評価において、Doubao Pro・Gemini 2.5 Pro・GLM-4.6・Qwen3 Maxの4モデルがそれぞれ6点以上のスコア上昇を記録し、下落したモデルはゼロ。Grok 4は94.00点で首位を堅持し
WDCD v3.1の5大制約シナリオ横断評価では、業務ルールシナリオで全体スコアが最低となり、Doubao-Proはわずか1.83/4と、Grok-4の満点4/4を大幅に下回った。安全コンプライアンスシナリオでも1.87/4という極めて低い
8問のv2アンカー問題を対象とした評価において、11モデルのR3平均誠実率はわずか51.3%にとどまり、26回の完全崩壊(0点)が第3ラウンドの加圧後における制約遵守の系統的な劣化を如実に示した。
WDCD v3.1守約テストにおいて、Grok 4が94.00点で第1位を獲得し、Doubao Proは68.17点で第11位に沈んだ。両モデルのR3施圧ラウンド得点はそれぞれ1.50/2と0.88/2であり、この差が総合スコアに直接25.
4つの実際には無意味なルールを設定し、7ラウンドの対話でAIモデルにルール違反を誘導しようとしたが、いずれのモデルも一切違反しなかった。新たな行動ベースの評価システム「WDCD v4」の導入により、コードの実際の実行結果でコンプライアンスを
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #285では、11モデルを対象に多ターン対話における制約保持能力を評価した結果、平均コミットメント崩壊率が54.5%に達した。Grok 4が
WDCD v3.1パイロットデータでは、Gemini 2.5 Pro、GPT-5.5、Claude Opus 4.7、GPT-o3の4モデルが上昇し、Doubao Proのみが7.3点下落するという「4上昇・1下落」の構図が明確となった。
WDCD v3.1の5大シナリオクロス評価において、安全コンプライアンスシナリオが全モデルの守約能力の最大の弱点となり、Qwen3-maxが最下位の1.15/4点、GPT-5.5がトップの4/4点を記録し、最大スコア差は2.85点に達した。
8問のv2アンカー問題に対する3ラウンドのテストで、11モデルのR3平均誠実率はわずか22.7%に留まり、7回の完全崩壊(0点)が発生した。初期確認率100%から大幅に低下したこの結果は、連続的な圧力下で大多数のモデルが制約を維持できないこ
WDCD v3.1守約テストにおいて、Grok 4が97.50点で首位を獲得し、Qwen3 Maxは69.50点で11位(最下位)となった。両モデルの合計スコア差は28点に達する。
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #276では、11モデルを評価した結果、Grok 4が94.8点で首位となり、全体の平均指示遵守率の減衰は-18.2%となった。
WDCD v3.1テストにおいて、Doubao ProとGLM-4.6が大幅上昇した一方、GPT-o3とDeepSeek V4 Proが顕著に下落し、AIモデルの約束遵守能力ランキングが大きく変動した。現在のトップ5はGrok 4を筆頭に、
WDCD v3.1の5大場景横断評価において、ビジネスルール場景が全モデル中最低スコアの赛道となり、Qwen3-maxはわずか1.55/4点にとどまった。一方、Claude opus 4.7はデータ境界で4/4の満点を獲得しながらも、リソー
WDCD v3.1パイロットテストにおいて、11モデルがv2アンカー問題8問で明確な三ラウンド衰退を示した。R1確認率100%、R2抵抗率86%に対し、R3誠実率はわずか59.1%にとどまり、GPT-o3は20%という突出した崩壊率を記録し
WDCD v3.1の遵約テストにおいて、Grok 4が94.80点で首位を獲得し、Qwen3 Maxは69.20点で11位に留まり、両モデルの合計点差は25.6点に達した。R3高圧ラウンドでの耐性が最終順位を大きく左右する結果となった。
Winzhengの動的コンテキスト減衰(WDCD)ベンチマーク第271回実行において、11モデルを評価した結果、グループ全体の平均指示減衰率はわずか0.9%を記録。Grok 4が総合首位を獲得し、Claude Sonnet 4.6は減衰率0
WDCD v3.1の最新評価(Run #271)において、Claude Sonnet 4.6が83.72点を記録して8.8ポイント上昇、Doubao Proは16ポイント下落した。11モデル中、上昇は2モデル、下落は1モデルにとどまり、首位
WDCD v3.1の5シナリオ横断評価において、データ境界シナリオの全体スコアが最も低く、11モデルの平均はわずか約2.8点であった。Doubao-proは1.4/4点で唯一2点を下回り、gpt-o3とgrok-4が3.6/4点で並んだ。
v2アンカーポイント問題8問のサンプリングにおいて、11モデルのR3完全崩壊が34/275回に達し、Doubao ProのR3崩壊率は32%に上る一方、Grok 4は崩壊ゼロを維持した。初回確認率が90%に達するモデルでも、第3ラウンドの圧