GPT-o3の総合スコアが15点急落——コード実行が100点から75点に低下

GPT-o3は本日のSmoke評価において総合スコアが85.15点から70.19点へと低下し、下落幅は15点となった。主な要因はコード実行ディメンションが100.00点から75.00点へと急落したことによる。

スコアの詳細分析

コード実行ディメンションは単日で25点下落し、素材制約は67.00点から64.30点へと2.7点低下した。エンジニアリング判断は100.00点を維持し、タスク表現は85.80点から100.00点へと上昇した。誠実性評価はpassを維持した。Smoke評価は毎日固定で10問出題され、各ディメンションにつき2問であるため、サンプル数が少なく、単日の変動は正常範囲内と見なされる。

変動要因の分析

コード実行ディメンションで25点の下落が生じた一方、素材制約はわずか2.7点の低下にとどまり、残り2つのサブランキングディメンションは横ばいまたは上昇した。これは問題がコード実行の抽選問題に集中していることを示している。Smoke評価では各ディメンションわずか2問のため、難易度の高いエッジケース問題1問だけで25点の低下を引き起こし得る。素材制約のわずかな下落がコード実行の落幅と連動していないことは、モデル全体の能力低下ではなく問題の無作為性を示唆している。エンジニアリング判断とタスク表現が影響を受けていないことも、今回の変化が主にコード実行問題の抽選結果に起因するとの見方を支持する。

利用者への示唆

コード実行に強く依存するチームは、本日以降ローカルでの検証工程を追加する必要がある。Smoke評価でのコード実行75点は、このモデルが特定のコードタスクにおいて明らかなエラーを起こす可能性があることを意味する。素材制約64.30点は、入力制約を厳密に遵守する必要があるシナリオでは依然としてリスクがあり、企業が導入を検討する際は人手によるレビュー工程を残しておくべきである。エンジニアリング判断の満点とタスク表現100点は、モデルが判断・表現の工程において依然として安定していることを示しており、強い推論能力を必要としつつコード量が比較的少ないアプリケーションに適している。

戦略的判断

現時点のデータは単一ディメンションの単日変動を示すにすぎず、複数日にわたる連続トレンドは提供されていないため、モデルの真の能力低下を判断することはできない。コード実行の25点下落と素材制約の2.7点下落の差異は、抽選要因の影響が大きいことを示唆している。次回のSmoke評価ではコード実行が90点以上に回復するかどうかを重点的に観察し、2日連続で80点を下回る場合に初めて深度再評価を実施することを推奨する。エンジニアリング判断とタスク表現の安定したパフォーマンスは短期利用の参考とし、コード実行ディメンションについては追加の監視が必要である。

今回の評価において、コード実行75.00点と前日の100.00点との対比は、モデルパラメータの調整ではなく問題難易度の変化を直接反映している。素材制約の64.30点と67.00点の微差も、小サンプルにおける無作為変動の特性と一致する。総合スコア70.19点は衝撃的ではあるものの、サブランキングのディメンションでは系統的な低下は見られないため、今回の事象は抽選による変動が主因であり、真の能力低下を示す証拠は不十分と判断する。

GPT-o3に依存する開発者にとって、本日のデータはコード生成のシナリオにおいてユニットテストのカバレッジを高めるよう示唆している。企業の導入選定においては、エンジニアリング判断とタスク表現のタスクには引き続き同モデルを使用できるが、コード実行の工程では人手またはツールによる二次検証を設けるべきである。次回のデータでコード実行が回復すれば、今回の70.19点は通常レンジの下限にすぎないが、低迷が続く場合はコード実行ディメンションの重み付けを再評価する必要がある。


データ出典:YZ Index | Run #322 | 元データを見る