GPT-o3のコード実行スコアが24.5点急落、メインランキングも15.2点下落――抽選の偶然か真の性能低下か

GPT-o3は本日のSmokeベンチマークにおいて、メインランキングのスコアが96.01から80.78へと低下し、コード実行の次元では97.00から72.50へと24.5点の急落を記録した。

データの事実:単一次元における極端な変動

昨日と本日のスコアを比較すると、コード実行で1日あたり−24.5点の変化が生じた。資料制約は94.80から90.90へと−3.9点の低下にとどまった。エンジニアリング判断は100.00を維持し、タスク表現は75.00から90.00へと15点上昇した。これらを受け、メインランキング全体で15.2点の下落となった。誠実性評価はpassを維持している。

Smokeベンチマークでは1日あたり各次元2問のみが出題されるため、サンプル数が極めて少ない。コード実行で1項目24.5点という下落幅は、少なくとも1問で大幅な得点低下が生じたことを意味する。資料制約の3.9点低下は通常の変動範囲内と言える。

原因分析:抽選による変動の可能性が高い

次元の構成から見ると、コード実行は特定の問題に対する感度が最も高い。2問のテストにおいて、境界条件が複雑な問題や多段階の推論を要する問題が出題された場合、モデルが1問を誤るだけで平均スコアが24.5点押し下げられる。資料制約の下落幅が小さいことは、忠実性に関するモデルの基礎能力に系統的な問題が生じていないことを示している。

エンジニアリング判断は2日連続で満点を維持し、タスク表現もむしろ上昇していることから、サブランキングの能力が同時に低下しているわけではないことがわかる。真の性能低下であれば、通常は複数の次元が同時に悪化するが、今回はコード実行のみが突出した変動を示しており、抽選による変動がより合理的な説明と言える。

ユーザーへの示唆

コード生成に強く依存するチームは、1日のSmokeスコアが日常的な使用パフォーマンスと直接イコールではないことに留意が必要だ。コード実行の72.50というスコアは、当日の2問の難易度分布を反映しているに過ぎない可能性があり、モデル全体のプログラミング能力が低下したわけではないかもしれない。

資料の忠実性を重視するユースケースへの影響は限定的であり、資料制約は90.90を維持しており、この下落幅はモデル選定の判断を変えるほどではない。エンジニアリング判断の満点は、判断系タスクにおいてモデルが依然として安定していることを示している。

戦略的判断:過度な懸念は不要

現行のスコア比較に基づけば、GPT-o3の今回のメインランキング下落は、モデルの真の性能低下ではなく、問題の抽選によるものである可能性が最も高い。エンジニアリング判断とタスク表現が安定ないし上昇していることも、この判断を裏付けている。

次回のSmokeベンチマークでも引き続きコード実行の次元を観察することを推奨する。2日連続で24点以上の類似した下落が生じた場合に限り、より大規模なデータセットによる検証を検討すべきだ。現時点の1日分のデータだけでは、モデルの能力低下という結論を導くには不十分である。

企業のモデル選定においては、引き続きGPT-o3をコード実行の候補として位置付けることができるが、1回の抽選結果に惑わされないよう、複数日の平均スコアやより大きなサンプルによるテストと組み合わせて評価することが望ましい。


データ出典:YZ Index | Run #341 | 元データを見る