Grok 4のメインランキングが8.8ポイント急落:コード実行が100点から90.7点に低下

Grok 4は本日のSmoke評価テストで、メインランキングのスコアが昨日の96.99点から88.14点に低下し、1日の落ち幅は8.8ポイントとなった。コード実行次元は100.00点から90.70点に低下し、素材制約は93.30点から85.00点に低下しており、この2次元の合計がメインランキングを押し下げた。

スコア変動の詳細分析

コード実行次元の落ち幅が最も大きく、9.3ポイントに達した。素材制約次元も同時に8.3ポイント低下した。エンジニアリング判断は69.50点から75.00点に上昇し、タスク表現は95.00点から91.70点に低下した。誠実性評価はpassを維持しており、閾値には触れていない。

考えられる原因の分析

Smoke評価テストでは毎日10問のみが出題され、2問が1つのメインランキング次元に対応する。コード実行と素材制約はそれぞれ2問が出題されるため、1問のミスで8〜10ポイント規模の変動が生じる可能性がある。昨日はコード実行が満点だったが、本日は90.70点となっており、これはモデル自体が突然退化したのではなく、難度の高いプログラミングまたはデバッグ問題が抽出されたことによる可能性が最も高い。素材制約も同時に低下していることから、本日の問題には原文への厳格な忠実性が求められるタスクが多く含まれていた可能性がある。

エンジニアリング判断が逆に5.5ポイント上昇したことは、サブランキングの問題抽出がメインランキングとは独立していることを示している。タスク表現の小幅な低下は3.3ポイントにとどまり、メインランキングの中核次元よりも変動幅は小さい。総合的に見て、本日の変動は問題抽出による揺らぎによるものであり、モデルの実際の能力が退化したわけではないと判断される。

利用者への影響

コード実行に強く依存する開発者チームは、Grok 4が高難度のプログラミングタスクにおいて1回の評価で大きな変動が生じる可能性があることに留意する必要がある。法律契約のレビューや技術文書の抽出など、素材制約への厳密さが求められるシーンでは、本日の85.00点という結果から、人手による追加確認プロセスを設けることが推奨される。

エンジニアリング判断の小幅な改善は、システム設計判断を重視するシーンへの影響は限定的である。メインランキング全体の88.14点は依然として実用可能な範囲内にあるが、複数日連続で90点を下回る場合はモデル選定の優先順位に影響が出てくる。

戦略的判断

1日分のデータに基づけば、Grok 4のメインランキングの落ち幅は主に問題抽出によるものであり、実際の能力退化を示すシグナルとはまだ言えない。次回のSmoke評価テストでコード実行と素材制約が共に95点以上に回復すれば、今回は通常の変動であったと確認できる。一方、90点を下回る状態が続く場合は、複雑な制約タスクにおけるモデルの安定性を重点的に検証する必要がある。

現時点では、Grok 4が過大評価または過小評価されているという証拠はなく、少なくとも3回の連続評価日まで観察を続けることを推奨する。


データ出典:YZ Index | Run #300 | 元データを見る