GPT-o3のSmokeベンチマーク総合スコアが急落8.3点――コード実行は100点から88.3点へ

GPT-o3は本日のSmokeベンチマークにおいて、総合スコアが昨日の96.27点から87.94点へと8.3点下落した。コード実行次元は100.00点から88.30点へ、素材制約は91.70点から87.50点へ、工程判断は94.80点から75.00点へそれぞれ低下した一方、タスク表現は75.00点から90.00点へ上昇した。誠実性評価は「pass」から「warn」へと変化した。

スコア変動の内訳

コード実行次元の下落幅が最も大きく、1日で11.7点の損失となった。素材制約は4.2点の低下、工程判断は19.8点の大幅下落となり、タスク表現は逆に15点上昇した。総合スコアはコード実行と素材制約の加重平均で構成されるため、この2次元の同時下落が全体の8.3点低下に直接反映されている。

考えられる原因の分析

Smokeベンチマークは1日10問・次元あたり2問という設計であり、出題サンプリングによるばらつきが最も有力な要因として考えられる。コード実行は昨日の2問がいずれも満点だったのに対し、本日の2問でスコアが低下しており、問題の難易度やカバーするシナリオに差異が生じた可能性がある。工程判断の下落幅が最大であることについては、本日の問題がマルチステップ推論や制約の競合を重視する内容だったため、このサブスコア次元におけるモデルの不安定性が露呈した可能性がある。素材制約のわずかな低下は、指定素材への忠実度に一定のばらつきが残ることを示している。タスク表現の上昇は、本日の問題がモデルにとって表現を構成しやすい内容だったことを示す。

真の性能劣化と出題サンプリングによるばらつきを区別するには、複数日にわたる継続データが必要である。現時点では1日分の比較のみであり、モデルの能力が体系的に低下しているかどうかは確認できない。誠実性評価が「warn」に転じたことは、一部の回答において一貫性またはコンプライアンス上の問題が発生していることを示唆しており、工程判断の大幅下落と関連している可能性がある。

利用者への具体的な意味

コード実行への依存度が高い開発チームは警戒を高める必要がある。昨日の満点パフォーマンスは潜在的なリスクを覆い隠していた可能性があり、本日の88.30点は、複雑なコード生成やデバッグのシナリオでモデルがエラーを起こす確率が上昇していることを意味する。素材制約の87.50点は、文書や仕様への厳格な準拠が求められるシナリオに対して軽度の懸念をもたらす。工程判断の75.00点は、エンジニアリング上のトレードオフを要する意思決定タスクにおけるモデルの判断信頼性が低下していることを示す。

タスク表現の90.00点はコンテンツ生成系タスクへの影響が比較的小さい。誠実性評価の「warn」については、企業が本番環境への導入前に人間によるレビュー工程を追加し、モデル出力における境界違反の発生を防ぐことが求められる。

戦略的判断

現在の1日分のデータに基づけば、GPT-o3の総合スコア低下はコード実行と工程判断のばらつきによって主に引き起こされている。出題サンプリングの差異がより有力な説明であるが、工程判断の19.8点という下落幅は通常の1日のばらつき範囲を超えており、次回以降の追跡を続ける価値がある。工程判断とコード実行が2日連続で低い水準にとどまる場合、複雑な制約シナリオにおけるモデルの真の一貫性問題を検討する必要が生じる。

現時点のデータはモデル全体の能力に関する長期的な結論を支持するものではなく、本日のSmokeベンチマークにおいてGPT-o3がコード実行と工程判断の2次元で顕著なばらつきを示したことを示すにとどまる。このモデルに依存するチームは、次回のベンチマーク結果が公開された後に、利用戦略を調整するかどうかを判断すべきである。


データ出典:YZ Index | Run #241 | 元データを見る