GPT-o3は本日のSmokeベンチマークにおいて、メインランキングスコアが昨日の96.01点から80.48点へと低下し、下落幅は15.5点となった。このうちコード実行次元は97.00点から64.50点へと32.5点落ち込んだ。
データの内訳:主要次元の変化
メインランキングはコード実行と資料制約の2つの監査可能な次元のみで構成されている。本日のコード実行は64.50点、資料制約は100.00点であり、単純平均で80.48点となった。昨日の対応数値はコード実行97.00点、資料制約94.80点で、平均96.01点だった。資料制約は本日むしろ5.2点上昇しており、モデルの資料忠実度に系統的な問題が生じていないことを示している。
サブランキング(AI補助評価)のデータでは、エンジニアリング判断が88.90点から77.30点へ低下し、タスク表現が65.00点から90.00点へ上昇した。誠実性評価はpassを維持しており、閾値警告は発動していない。
原因分析:抽選による変動か、真の性能劣化か
Smokeベンチマークは1日あたり各次元2問・計10問のみであり、サンプル数が極めて少ない。コード実行における1日32.5点の下落は、モデルパラメータレベルの劣化よりも、出題抽選による難易度や問題タイプの差異に起因する可能性が最も高い。資料制約が同期間に5.2点上昇していることも、全体的な能力低下ではなく変動であるという判断をさらに裏付けている。エンジニアリング判断の11.6点低下はコード実行の問題と関連している可能性があるが、タスク表現が25点上昇していることは、表現系タスクにおいてモデルが応答品質を維持または向上させていることを示している。
真の性能劣化であれば、資料制約が同時に上昇するはずはない。現在の2次元の逆方向の動きは、小サンプルのランダム変動の特徴により合致している。
ユーザーへの示唆
コード実行を重視するチームがGPT-o3を導入する際は、特に数値計算やアルゴリズム実装のシナリオで冗長な検証ステップを追加する必要がある。資料制約が100.00点であることは、原文の厳密な引用が求められる文書処理タスクにこのモデルが引き続き適していることを示している。エンジニアリング判断77.30点(サブランキング、AI補助評価)は、複雑なシステム設計の工程において人的レビューが必要であることを示唆している。
開発者が単日のSmokeベンチマーク結果のみでモデル選定を決定した場合、実際の安定性を過大または過小評価するリスクがある。
戦略的判断
本日のデータに基づくと、GPT-o3のコード実行の一貫性は次回以降も継続的に追跡する価値がある。メインランキングの80.48点は依然として多くの競合モデルのベースラインを上回っているが、単一次元での32.5点の変動はすでに通常の範囲を超えている。資料制約の満点とコード実行の低スコアが併存していることは、モデルが異なる能力軸において分化した性能を示していることを意味する。次回のSmokeではコード実行が90点以上に回復するかどうかを重点的に観察し、偶発的な変動と系統的な変化を区別することを推奨する。
現時点ではモデル全体の性能劣化を裏付ける証拠はなく、ユーザーは直ちに乗り換えるのではなく、引き続き観察することが望ましい。
データソース:YZ Index | Run #335 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接