GPT-o3のコード実行スコアが21.8点急落、資料制約スコアは33.5点上昇、総合ランキングは小幅上昇

本日のSmokeベンチマークにおいて、GPT-o3のコード実行スコアが昨日の93.80点から72.00点へと21.8点下落した一方、資料制約スコアは49.30点から82.80点へと33.5点上昇し、総合スコアは73.78点から76.86点へと小幅に上昇した。

データの事実分解

今回のベンチマークは1日あたり10問(各評価軸につき2問)のみを対象としている。コード実行軸では昨日の93.80点が比較的高い正答率に対応しており、本日の72.00点は2問中少なくとも1問で明らかなエラーが発生したことを意味する。資料制約軸では昨日の49.30点が低い制約遵守率に対応していたが、本日の82.80点は2問ともに資料の制限をおおむね満たしたことを示している。エンジニアリング判断は88.90点から100.00点へ上昇し(サブランキング、AI補助評価)、タスク表現は66.70点から90.00点へ上昇した(サブランキング、AI補助評価)。誠実性評価は「warn(警告)」から「pass(合格)」へ改善された。

原因分析:抽選による変動か、真の性能低下か

Smokeベンチマークの1日あたりのサンプル数は極めて少なく、2問だけで20点以上のスコア変動が生じ得る。コード実行と資料制約が同時に逆方向の急激な変化を示した最も有力な説明は、本日抽選されたコード実行問題の難易度やトラップの分布が昨日と異なっており、一方で資料制約問題がたまたまモデルの現在の得意分野に合致したというものである。複数日にわたって同一評価軸で継続的な低下が見られないため、モデルの真の性能低下という結論を支持するデータは現時点では存在しない。

利用者への具体的な意味

GPT-o3をコード実行に重度に依存しているチームは、ローカルでの検証ステップを追加する必要がある。本日の72.00点は、一部のコードシナリオにおいてモデルのエラー率が顕著に上昇していることを意味するためだ。資料制約に敏感なシナリオ(長文書の書き換えや厳格なフォーマット出力など)では本日の性能が改善しており、82.80点を短期的な参考値として活用できる。総合スコアの76.86点は依然として中位圏にあり、コードと資料制約の両方を必要とする混合タスクにおいて、モデルの安定性はまだ本番環境への直接投入が可能なレベルには達していない。

戦略的判断

今回の21.8点の下落と33.5点の上昇という組み合わせは、モデルの能力における構造的な変化ではなく、問題の抽選による無作為な変動である可能性が高い。次回以降もコード実行軸の追跡を継続し、2日連続で80点を下回った場合に初めて詳細な再テストを実施することを推奨する。現時点のデータは、GPT-o3のコード実行能力に対する長期評価の引き下げを支持するものではない。


データ出典:YZ Index | Run #345 | 元データを見る