Grok 4のコード実行スコアが96.30点から69.50点に急落、メインランキングは1日で10点下落

Grok 4は本日のSmokeベンチマークにおいて、メインランキングのスコアが昨日の90.86点から80.89点に下落した。コード実行ディメンションは96.30点から69.50点へと急落した一方、資料制約ディメンションは84.20点から94.80点へと上昇した。

データの詳細分析

メインランキングはコード実行と資料制約の2つのディメンションのみで構成されている。本日のコード実行ディメンションは1日で26.8点を失い、メインランキングを約13.4点押し下げた。資料制約ディメンションが同期間に10.6点回復したことで一部の下落を相殺し、最終的にメインランキングは正味10点の下落となった。エンジニアリング判断サイドランキング(AI補助評価)は61.10点から36.10点に下落し、タスク表現サイドランキング(AI補助評価)は70.00点から90.00点に上昇した。誠実性評価は「pass」を維持している。

Smokeベンチマークは1日あたり各ディメンション2問・計10問のみで構成される。1問あたりのスコアウェイトが高く、問題抽選の差異によって20点以上の変動が生じ得る。

原因分析

コード実行ディメンションの下落幅が資料制約ディメンションの上昇幅を大幅に上回っていることは、本日抽選された2問のコード問題の難易度や種類がモデルの現時点での弱点と合致した可能性が最も高い。資料制約ディメンションのスコア上昇は、同じ問題セットにおいて資料への忠実度が求められる部分ではモデルがむしろより良好なパフォーマンスを発揮したことを示しており、全体的な能力の系統的な退化は否定される。

エンジニアリング判断とタスク表現の2つのサイドランキングがそれぞれ25点・20点規模の変動を同時に示したことは、今回のベンチマーク結果が問題のランダム性に大きく影響されたものであり、モデルのパラメータや学習に変化が生じたわけではないことをさらに裏付けている。

ユーザーへの示唆

コード生成に強く依存するチームは注意が必要だ。Grok 4はSmokeベンチマークのコード実行スコアで1日に26.8点規模の変動が生じており、特定のプログラミングタスクで予測不能な失敗が発生する可能性があることを意味する。資料制約スコアが94.80点まで回復したことは、所定のドキュメントや指示を厳格に遵守することが求められるシナリオにおいて引き続き高い信頼性を保っていることを示している。

複数モデルを並行利用している開発者にとって、本日のGrok 4のパフォーマンスは、資料処理の代替候補として活用できる一方、コード実行の工程では依然として人手によるレビューや他モデルの並列呼び出しを維持する必要があることを示唆している。

戦略的判断

現時点のスコア比較に基づくと、Grok 4の今回のメインランキング下落は、コード実行ディメンションの1日限りの抽選変動が主因であり、モデルの実質的な能力低下ではない。資料制約ディメンションの同時上昇もこの判断を支持している。次回のSmokeベンチマークでもコード実行スコアを継続的に追跡し、2日連続で80点を下回った場合に初めてモデル能力の変化を検討することを推奨する。

現時点のデータは、Grok 4のコード能力に関する評価引き下げの結論を支持しない。1日10問というテストの固有の変動性がより合理的な説明である。


データ出典:YZ Index | Run #335 | 元データを確認