GPT-o3は本日のSmokeテストにおいて、メインランキングが80.61点から66.86点へ低下し、コード実行次元が70.30点から48.50点へ下落、単日の下落幅は21.8点に達した。
データの事実
スコア比較によると、コード実行は70.30点から48.50点へ、素材制約は93.20点から89.30点へ低下し、メインランキングは13.8点の下落となった。エンジニアリング判断は75.00点から97.00点へ上昇し、タスク表現は90.00点から66.70点へ低下した。誠実性評価はpassを維持した。
原因分析
Smokeテストは1日あたり10問のみで、各次元2問ずつ出題される。問題の抽選による変動が主なメカニズムとなっている。コード実行次元の下落幅が最大であったことは、当日抽選された2問がモデルの現在の安定処理範囲を超えていた可能性を示している。素材制約はわずか3.9点の低下にとどまっており、素材への忠実度に関するモデルの基礎能力に系統的な劣化は生じていないことを示す。エンジニアリング判断が22点大幅上昇し、タスク表現が23.3点低下したことは、異なる次元における問題難易度の分布の不均一さを反映しており、モデル全体の能力変化ではない。
利用者への意味
コード実行を重視するチームは注意が必要である。単日のSmokeテストでコード実行が48.50点であることは、このモデルが複雑なコードタスクを処理する際に顕著な不安定さが生じる可能性を意味する。素材制約は89.30点を維持しており、素材への忠実度が重要なシナリオでは引き続き利用可能である。エンジニアリング判断97.00点は、エンジニアリング意思決定の補助シナリオで優れたパフォーマンスを示している一方、タスク表現66.70点は、構造化出力の生成時に追加検証が必要であることを示唆する。
戦略的判断
今回のメインランキング下落は主にコード実行の単日変動によるものであり、素材制約の変化幅は小さく、現時点では真の劣化シグナルとはなっていない。次回もコード実行次元が70点付近まで回復するかどうかを引き続き観察することを推奨する。コード実行が2日連続で50点を下回るようであれば、モデルの能力に系統的な変化が生じているかどうかを検討すべきである。
データソース:YZ Index | Run #237 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接