GPT-o3のコード実行スコアが24.7点急落、総合スコアは78.13に低下――Smoke評価の異常に要注意

GPT-o3は本日のSmoke評価において、コード実行次元のスコアが昨日の94.50点から69.80点へと24.7点急落し、総合スコアも86.04点から78.13点へと7.9点低下した。

データの事実:次元間の乖離が顕著

資料制約は75.70点から88.30点へと12.6点上昇。エンジニアリング判断は97.00点から74.80点へと22.2点下落。タスク表現は86.70点から70.80点へと15.9点下落。誠実性評価はpassを維持。

原因分析:題目抽選による変動の可能性が高い

Smoke評価は1日あたりわずか10問、各次元2問構成である。コード実行とエンジニアリング判断が同時に大幅下落した一方、資料制約が逆に上昇したことは、題目の抽選が次元ごとに異なる影響を与えていることを示している。コード実行とエンジニアリング判断の問題が複雑な計算や多段階推論のシナリオに集中し、GPT-o3がこれらの特定問題でミスを犯してスコアが集中的に下落した可能性がある。資料制約スコアの上昇は、当日の資料制約問題の難易度や種類が現在のモデルの能力に適していたことを示している。

モデルの真の性能劣化であれば、通常は複数のコア次元が同時に低下するはずであり、資料制約が大幅上昇するような補完的な動きは見られないはずだ。したがって、題目抽選の変動がより可能性の高い原因といえる。

利用者への示唆

コード実行を重視するチームがGPT-o3をアルゴリズム実装やデータ処理タスクに活用する際は、人的レビューのプロセスを追加する必要がある。資料制約スコアの上昇により、情報源への忠実度が求められる文書生成や引用シナリオでは引き続き利用可能だ。エンジニアリング判断の下落幅が大きいため、多段階の意思決定を必要とする自動化フローについては、短期的に信頼度の重み付けを下げるべきである。

戦略的判断

1日分のデータに基づけば、総合スコアの低下はコード実行とエンジニアリング判断が主な要因であり、資料制約による補完はモデル全体の能力に系統的な劣化が生じていないことを示している。次回の評価でコード実行とエンジニアリング判断が同時に回復すれば、今回が抽選変動であったと確認される。低迷が続くようであれば、さらなる検証が必要となる。現時点ではGPT-o3の総合能力を下方修正する必要はないが、コード実行シナリオの利用者は警戒を高めるべきである。

今回の評価は改めて、Smoke評価の1日あたりの変動幅が大きいことを示している。24.7点というコード実行の下落幅は小サンプルの範囲では許容範囲内だが、重点的に追跡すべき閾値に近づいている。資料制約の12.6点上昇は反対方向の証拠を提供しており、性能劣化ではなく変動という判断を支持している。

モデル選定を行う企業にとって、GPT-o3の資料制約次元における88.30点は依然として競争力があり、文書関連タスクの候補として活用できる。コード実行の69.80点はすでに大半の主流モデルの日常的な水準を下回っており、コード生成に大きく依存する開発者は切り替えまたは並行検証の方策を準備すべきである。

エンジニアリング判断74.80点とタスク表現70.80点の同時下落は、モデルのパラメーター層の問題ではなく、当日の問題における推論チェーン上の集中的なミスをさらに示唆している。誠実性評価のpassは変わらず、基本的な出力規範の問題は排除された。

以上を総合すると、GPT-o3の今回のSmoke評価における異常は題目抽選の変動に起因する可能性が最も高く、現時点ではモデルの真の性能劣化を示すシグナルには該当しない。次回の評価でコード実行とエンジニアリング判断が同時に回復するかどうかを重点的に観察し、トレンドを確認することを推奨する。


データ出典:YZ Index | Run #317 | 元データを見る