Grok 4は本日のSmokeベンチマークにおいて、コード実行スコアが96.70点から74.30点へ急落し、総合ランキングスコアが88.33点から75.38点へと13点低下した。
スコア詳細と各評価軸の内訳
総合ランキングはコード実行と資料制約の2項目を加重合算して算出される。本日のコード実行スコアは74.30点で、前日の96.70点から22.4点低下した。資料制約は78.10点から76.70点へと1.4点の微減にとどまった。エンジニアリング判断サイドランキング(AI補助評価)は72.20点から36.10点へ急落し、タスク表現サイドランキング(AI補助評価)は75.00点から70.80点へ低下した。誠実性評価はwarnからpassへと改善した。
変動要因の分析
Smokeベンチマークは各評価軸につき1日2問のみ出題されるため、1問あたりの配点ウェイトが高い。コード実行の落ち幅が最も大きかった点は、本日出題されたプログラミング問題の難易度が前日に比べて大幅に高かったことを示唆している。資料制約が比較的安定を保っていることは、モデルが与えられた資料に対する忠実度に系統的な劣化が生じていないことを示す。エンジニアリング判断サイドランキングの大幅な低下も、モデル全体の能力変化ではなく、当日問題が推論チェーンに対してより高い要求を課していたことに起因する可能性が高い。
真の劣化と出題のばらつきによる変動を区別する上では、複数評価軸にわたる一貫性が重要となる。資料制約はわずかな低下にとどまり、誠実性評価はむしろ改善しており、モデル能力が系統的に低下したという証拠は乏しい。1日10問というテスト規模では標準偏差が本質的に大きく、22.4点の下落は小サンプルの範囲内での正常な変動と見なせる。
利用者への具体的な影響
コード生成への依存度が高いチームは、本日の運用において人的確認プロセスを追加すべきであり、特に複雑なアルゴリズムや多段階デバッグを伴うタスクでは注意が必要だ。資料制約は76.70点を維持しており、原文の厳密な引用が求められる文書処理シナリオへの影響は限定的である。エンジニアリング判断サイドランキングが36.10点を示したことは、長い推論チェーンを要するアーキテクチャ設計タスクにおいて、現時点の出力一貫性が前日水準を下回っていることを意味する。
戦略的判断
今回の低下は主にコード実行評価軸における1日の出題ばらつきによるものであり、資料制約と誠実性評価が同時に悪化していないことから、モデルの真の劣化を示す明確なシグナルとは判断されない。次回のSmokeベンチマークでコード実行スコアが引き続き80点を下回る場合は優先度を上げて注視する必要があり、90点以上に回復した場合は本日の結果が孤立した変動であったと確認できる。
データ出典:YZ Index | Run #330 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接