GPT-o3、コード実行スコアが52.5点急上昇――素材制約は15.7点下落、総合ランキングは21.8点上昇

GPT-o3は本日のSmokeベンチマークにおいて、コード実行スコアが昨日の44.50点から97.00点へ上昇し、素材制約スコアは100.00点から84.30点へ低下、総合ランキングスコアは69.48点から91.29点へ上昇した。

スコア変動の事実

コード実行の評価軸は1日で52.5点上昇し、素材制約の評価軸は1日で15.7点下落した。エンジニアリング判断は100.00点で変わらず、タスク表現も75.00点のまま維持された。誠実性評価は「pass」を維持。総合ランキングスコアはコード実行と素材制約の2つの中核評価軸によって構成されており、本日の総合スコアは21.81点上昇した。

変動要因の分析

Smokeベンチマークは1日あたり10問、各評価軸2問のみで構成されており、サンプル数が少ないため、1日単位の変動は正常な範囲内に収まる。コード実行スコアが44.50点から大幅に回復したことは、このモデルが本日抽出されたコード系問題において安定したパフォーマンスを発揮したことを示している。素材制約スコアの15.7点下落については、本日抽出された素材系問題が忠実度に対してより高い要求を課していたか、あるいはモデルが特定の制約シナリオで一時的な偏差を起こした可能性がある。

評価軸の構成から見ると、素材制約の下落はコード実行の上昇を相殺するには至らず、総合ランキングは引き続き純増となった。これは2つの評価軸の問題抽出が独立していることを示しており、本日の素材制約における失点は一部の問題に集中したものであり、全評価軸にわたる系統的な劣化ではない。

利用者への具体的な意味

コード実行を重視するチームにとって、本日のデータはより高い信頼度を与えるものであり、GPT-o3のコード生成・デバッグシナリオにおける実用性は向上している。一方、契約書の情報抽出・長文書の要約・指示追従型タスクなど、素材の忠実度に依存するシナリオでは、出力が制約違反を起こしていないかを追加検証する必要がある。

企業の採用判断において、本日の素材制約スコア84.30点は依然として実用可能な水準にあるものの、昨日の100.00点を下回っており、素材への精度が求められるプロジェクトでは人手による抜き取り検査の工程を追加することが推奨される。GPT-o3を自動化フローに組み込む開発者は、本日のデータを踏まえ、素材出力に対して二次検証ルールを設けることが望ましい。

戦略的判断

今回の素材制約スコアの下落は、モデルの真の劣化によるものではなく、問題抽出の変動によってもたらされた可能性が高い。その根拠として、コード実行が対称的に大幅回復していること、エンジニアリング判断とタスク表現という2つのサブランキング評価軸が変化していないこと、そしてシステム全体として一貫した低下シグナルが見られないことが挙げられる。

次回の評価で素材制約スコアが引き続き90点を下回る場合はさらなる注視が必要であるが、95点以上に回復した場合は本日の変動が孤立したものであると確認できる。現時点のデータは、GPT-o3の素材制約能力に対する長期的な下方修正判断を支持するものではない。


データ出典:YZ Index | Run #248 | 元データを見る