GLM-4.6が29.8ポイント急落、GPT-5.5も6ポイント低下——WDCD約束遵守テストで両モデルが全面後退
WDCD v3.1パイロットデータによると、GLM-4.6のスコアが前回Run #326比で29.8ポイント、GPT-5.5が6ポイント低下し、上昇したモデルはゼロだった。Grok 4が91.76点でトップを維持している。
WDCD v3.1パイロットデータによると、GLM-4.6のスコアが前回Run #326比で29.8ポイント、GPT-5.5が6ポイント低下し、上昇したモデルはゼロだった。Grok 4が91.76点でトップを維持している。
WDCD v3.1テストでGrok 4が93.21点で11モデル中1位を獲得。Qwen3 Maxは74.31点で最下位となり、両者の差は18.9点に達した。
WDCD v3.1パイロット評価において、Doubao Pro・Gemini 2.5 Pro・GLM-4.6・Qwen3 Maxの4モデルがそれぞれ6点以上のスコア上昇を記録し、下落したモデルはゼロ。Grok 4は94.00点で首位を堅持し
WDCD v3.1守約テストにおいて、Grok 4が97.50点で首位を獲得し、Qwen3 Maxは69.50点で11位(最下位)となった。両モデルの合計スコア差は28点に達する。
WDCD v3.1の約束遵守テストにおいて、評価対象9モデル全てがスコアアップを記録。DeepSeek V4 Proが23.6点の大幅上昇で91.36点に達したが、Grok 4の91.40点にわずか0.04点差で及ばなかった。