Grok 4は本日のSmoke評価テストにおいて、材料制約スコアが昨日の100.00点から77.80点へと22.2点下落し、総合ランキングスコアは93.79点から88.64点に低下した。
スコア比較データ
コード実行は88.70点から97.50点へ8.8点上昇、エンジニアリング判断は75.00点から30.60点へ44.4点下落、タスク表現は45.80点から95.00点へ49.2点上昇した。誠実性評価は「pass」を維持している。
変動要因の分析
Smoke評価テストは1日あたり各次元2問、計10問のみである。材料制約とエンジニアリング判断が同時に大幅下落する一方、コード実行とタスク表現が同程度上昇したことから、スコア変動の主因はモデル能力の系統的な劣化ではなく、問題抽選のランダム性である可能性が高い。材料制約の2問のうち1問において、原文への忠実な再現が厳しく求められる設問でモデルがわずかな言い換えを行った場合、当該次元のスコアが満点から77.80点へ直接急落することがある。
利用者への示唆
法律契約の要約や学術引用の照合など、原文への忠実度を重視するシナリオでは、人手による追加確認フローを設けることを推奨する。コード実行に依存する開発者は本日のパフォーマンスを引き続き活用できるが、エンジニアリング判断の30.60点は、多段階推論の一貫性における不安定さを反映している可能性があるため注意が必要である。
戦略的判断
1日分のデータのみをもとに、総合スコアの5.2点下落をもってモデルの真の劣化と判断することは尚早である。次回以降、材料制約とエンジニアリング判断が同時に回復するかどうかを重点的に観察し、2日連続で80点を下回った場合に初めて詳細な再テストを実施することを推奨する。現在の変動は通常の抽選範囲内であり、モデル選定の優先順位を直ちに見直す必要はない。
全体として、Grok 4の本日のパフォーマンスは小サンプルによる高分散という典型的な特徴を示している。材料制約77.80点とコード実行97.50点が逆方向に動いたことは、問題内容の差異が主因であるという見方をさらに裏付けている。企業がモデル選定を行う際には、Smoke評価テストを参考シグナルのひとつとして位置づけ、唯一の根拠とするのではなく、複数日の平均値と組み合わせてモデルの真の実力を判断することが望ましい。
データ出典:YZ Index | Run #318 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接