GPT-o3は本日のSmokeベンチマークにおいて、総合スコアが昨日の100.00点から89.92点へと10.1点下落した。主な要因は、素材制約次元が100.00点から77.60点へ下落したことによる。
スコア詳細と直接比較
コード実行次元は昨日・本日ともに100.00点で変化なし。素材制約次元は昨日100.00点・本日77.60点で、22.4点の下落。エンジニアリング判断次元は75.00点から95.80点へ20.8点上昇。タスク表現次元は90.00点から85.00点へ5点下落。誠実性評価はpassを維持。
原因分析:抽出のランダム変動か、真の性能劣化か
Smokeベンチマークは1日あたり各次元2問のみ出題されるため、素材制約次元で本日出題された2問のスコアが直接この次元を22.4点押し下げた。コード実行次元の2問は満点を維持しており、コード関連タスクにおいてモデルに系統的な問題が生じていないことを示している。エンジニアリング判断次元はむしろ20.8点上昇しており、当該サイドベンチマークのタスクにおけるモデルのパフォーマンスが改善していることを示す。タスク表現は5点の小幅下落にとどまっており、影響は限定的だ。総合的に見ると、素材制約次元の1日での大幅下落は、本日出題された2問が素材への忠実度に対する要求が高く、引用または制約遵守において減点が生じたことに起因する可能性が最も高く、全体的な能力の劣化ではないと考えられる。
利用者にとっての具体的な意味
コード実行を重視するチームは引き続きGPT-o3を活用できる。当該次元は2日連続で満点を記録しており、実行の安定性は影響を受けていない。素材への忠実度が重要なシナリオ(契約情報の抽出、文献要約、データ引用タスクなど)においては、本日の77.60点という結果が、モデルの出力が与えられた素材から逸脱しないよう人的確認プロセスを追加する必要性を示唆している。エンジニアリング判断サイドベンチマークは95.80点まで上昇しており、モデルによる方案評価の補助を必要とする開発者にとって、本日のパフォーマンスは昨日を上回っている。
戦略的判断
総合スコアの10.1点下落は素材制約という単一次元の22.4点下落に完全に起因しており、他のコア次元は同期して悪化していない。したがって、モデル全体の劣化と即断する必要はない。次回のSmokeベンチマークで素材制約次元が引き続き同様の低スコアを示した場合は重点的な検証が必要となるが、95点以上に回復した場合は本日の結果を抽出のランダム変動と判断できる。現時点のデータが支持する結論は、素材制約次元がGPT-o3の短期的な注目ポイントとなる一方、コード実行次元は依然として満点という優位性を維持しているということだ。
データ出典:YZ Index | Run #298 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接