GPT-o3のSmokeベンチマーク総合スコアが1日で9点急落——資料制約ディメンションが20点下落

GPT-o3は本日のSmokeベンチマークにおいて、総合スコアが昨日の96.93点から87.93点へ9点下落した。主な要因は資料制約ディメンションが95.00点から75.00点へ急落したことである。

スコア比較データ

コード実行ディメンションは98.50点で変化なし。資料制約ディメンションは20点下落。エンジニアリング判断は65.30点から75.00点へ上昇、タスク表現は65.00点から91.70点へ上昇。誠実性評価はpassを維持。

データの事実分析

Smokeベンチマークは1日あたり10問で、各ディメンション2問ずつ構成される。資料制約ディメンションが1日で20点を失い、総合スコアを直接9点押し下げた。他の2つのサブスコアディメンションは明確な回復を示しており、タスク表現は26.7点上昇した。

考えられる原因の分析

出題の抽選による変動が最も有力な説明である。1日2問の資料制約問題には、より厳格な引用要件や長いコンテキストが含まれていた可能性があり、モデルが単回の回答でその制約条件を満たせず、当該ディメンションのスコアが95.00点から75.00点へ直接落ち込んだと考えられる。モデルの実質的な能力劣化の可能性は低い。コード実行ディメンションに一切の低下が見られず、2つのサブスコアディメンションも同時に上昇しており、モデル全体の出力能力に系統的な衰退が生じていないことを示している。

エンジニアリング判断とタスク表現の向上は、本日の抽選問題がモデルの構造化表現における強みとより適合していたためと考えられ、資料制約問題との間に補完関係が生じた。1日分のデータのみではランダムな変動と実際の能力変化を区別することはできないが、2問しかないテストにおける単一ディメンションの20点という大幅な下落は、通常範囲内の極端なサンプルに該当する。

利用者への示唆

資料制約を重視するシナリオでは、企業は追加の人的確認プロセスを設ける必要がある。GPT-o3を使って出典引用付きのレポート、契約条項、または技術文書を生成するチームに対し、本日のデータは単回出力で制約が機能しない可能性があることを示唆しており、重要な出力の後に二次確認ステップを追加することを推奨する。

コード実行への依存度が高い開発者については、98.50点が変わらず維持されており、短期的には引き続き当モデルをプログラミングタスクに活用できる。資料の忠実性とエンジニアリング判断を同時に求める複合シナリオでは、資料制約部分を他のモデルまたは人手による処理に分割することを推奨する。

戦略的判断

今回の総合スコア9点下落は、主に資料制約という単一ディメンションの極端な変動に起因するものであり、モデル全体の能力劣化ではない。エンジニアリング判断とタスク表現の同時上昇は、変動による説明をさらに裏付けている。次回のSmokeベンチマークでは資料制約ディメンションが90点以上に回復するかどうかを観察する必要があり、もし2日連続で75点前後に留まるようであれば、このモデルの資料制約シナリオにおける適用性を再評価する必要がある。

現時点のデータは、GPT-o3の資料制約ディメンションにおけるパフォーマンスを系統的な問題と判断することを支持しない。モデル選定チームには、単日の結果に基づいてデプロイ計画を変更するのではなく、今後3〜5日間の同一ディメンションのスコア標準偏差を継続的に追跡することを推奨する。


データ出典:YZ Index | Run #284 | 元データを見る