WDCD Run #253:Grok 4が94.8点でトップ、平均指示減衰率は4.5%
WinzhengのWDCDベンチマーク第253回実行において、Grok 4が94.8点で首位を獲得。11モデルを対象とした評価では、平均指示コミットメント減衰率は4.5%となった。
WinzhengのWDCDベンチマーク第253回実行において、Grok 4が94.8点で首位を獲得。11モデルを対象とした評価では、平均指示コミットメント減衰率は4.5%となった。
WDCD v3.1守約テストのRun #253において、Claude Opus 4.7が6.8点上昇、Claude Sonnet 4.6が6.7点上昇した一方、Gemini 3.1 Proが5.6点下落し、多段階の段階的圧力下でのモデル間の
WDCD v3.1の5大シナリオ横断評価において、ビジネスルールシナリオが全モデルにとって最難関となり、エンジニアリング規範シナリオでは最大3点という大きなスコア差が生じた。Claude-opus-4.7はエンジニアリング規範のみ3/4にと
8問のv2アンカー問題を用いた3ラウンドテストにおいて、11モデルの平均R1確認率は0.95、R2抵抗率は0.86だったが、R3誠実率は45.5%まで低下し、9回の完全崩壊(0点)が発生した。この結果は、持続的なプレッシャー下でのモデルの約
WDCD v3.1守約テストにおいて、Grok 4が94.80点で首位を獲得し、Doubao Proは64.20点で11位に終わり、両者の差は30.6点に達した。
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #247では、11モデルを対象に多ターン対話における指示遵守の減衰を測定し、平均指示減衰率は-1.8%を記録。上位モデルは減衰どころか指示遵
WDCD v3.1パイロット評価のRun #247において、Grok 4が94.20点で首位を維持する一方、Claude Opus 4.7とGemini 3.1 Proはいずれも5点以上下落し83点台に後退した。
WDCD v3.1の契約遵守テストにおいて、ビジネスルールシナリオの平均スコアが最低となり、Claude-sonnet-4.6はわずか1.8/4点に留まった一方、Grok-4は満点4/4を獲得し、両者の差は2.2点に達した。
WDCD v3.1パイロットテストにおける8問のv2三段階アンカー問題の結果、11モデルのR3平均誠実率はわずか50.6%にとどまった。Grok 4がR3で1.63/2を達成しゼロ崩壊を記録した一方、GPT-o3とQwen3 Maxの崩壊率
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #242において、Grok 4とGLM-4.6が指示劣化率0%でトップを維持する一方、Gemini 3.1 Proは-100%という最悪の結
最新のWDCD v3.1守約テストにおいて、GLM-4.6が13.7点上昇して92.00点に達した一方、GPT-o3は6.9点下落して87.10点となり、上位5モデルの内部順位が大きく塗り替えられた。
WDCD v3.1の契約遵守テストにおいて、リソース制限シナリオでgpt-5.5が1.55/4と最低スコアを記録し、全5シナリオ中の最大スコア差は2.45点に達した。モデルの契約遵守能力はシナリオ固有の特性であり、単一シナリオの成績から全体
v2アンカー問題8問のみを対象とした3ラウンドテストにおいて、11モデルのR3平均誠実率はわずか40.9%にとどまり、4モデルがR3で完全崩壊(0点)を記録した。崩壊事例はすべてビジネスルール類の制約に集中している。
WDCD v3.1コンプライアンス遵守テストにおいて、Grok 4が93.80点で11モデル中最高得点を記録し、Doubao Proが67.30点で最下位となった。両者の差は26.5点に達し、多ターン段階的プレッシャー下での制約保持能力に大
Winzheng Dynamic Contextual Decay(WDCD)ベンチマークのRun #233において、GPT-o3が94点・崩壊率0%で首位を獲得。一方、Gemini 3.1 Proは-100%という最悪の崩壊スコアを記録し
WDCD v3.1テスト(Run #233)において、Claude Sonnet 4.6が前回比15点上昇、GLM-4.6が15.3点下落という対称的な変動が観測され、11モデル中最も顕著な守約能力の二極化が明らかになった。
WDCD v3.1のパイロットデータにより、業務ルールシナリオが11モデル中で約束遵守生存率が最も低い次元であることが判明した。首位のDeepSeek V4 Proが4/4満点を獲得する一方、最下位のQwen3-maxはわずか1.55/4に
WDCD v3.1パイロットテストにおいて、11モデルすべてがR1・R2フェーズで100%の通過率を示したにもかかわらず、R3施圧フェーズでは平均誠実率が36.4%にとどまり、4モデルが完全崩壊(0点)を記録した。業務ルール類の制約が特に脆
WDCD v3.1守約ランキングでGPT-o3が94.00点で首位を獲得し、Qwen3 Maxが62.60点で最下位となった。評価対象の11モデルで首位と最下位の差は31.4点に達した。
WinzhengのWDCDベンチマークRun #227において、11の最先端モデルを対象に測定した結果、Grok 4とDeepSeek V4 Proが91.4点で同率首位を獲得した。全モデルの平均指示遵守減衰率は-2.8%だったが、モデルご