GPT-5.5のSmokeベンチマーク総合スコアが1日で12.5点急落——コード実行スコアは28点下落

GPT-5.5は本日のSmokeベンチマーク評価において、総合スコアが91.32点から78.80点へと12.5点下落した。主な原因はコード実行次元のスコアが100.00点から72.00点へと急落したことである。

スコア変動の内訳

コード実行次元は1日で28点下落した。一方、資料制約次元は80.70点から87.10点へ上昇し、エンジニアリング判断次元は100.00点を維持し、タスク表現次元は87.50点から100.00点へ上昇した。誠実性評価は「pass」を維持している。Smokeベンチマークは各次元1日2問・計10問の構成であり、1日単位の変動は通常の範囲内に含まれる。

考えられる原因の分析

コード実行次元の2問が全体スコアを引き下げた一方、資料制約とタスク表現の各次元はスコアが上昇しており、モデルが問題の種類によって顕著なパフォーマンスの差を示していることがわかる。最も有力な説明は出題のランダム性である。コード実行の2問が複雑な多段階推論やエッジケースを含む場合、モデルの出力に実行エラーが生じやすく、当該次元のスコアが大幅に低下する。資料制約次元のスコアが上昇していることから、モデルの引用制約への対応は同時に劣化していないことが示されている。

実際の能力劣化の可能性は低い。エンジニアリング判断次元が満点を維持し、タスク表現次元が12.5点上昇していることから、モデルのサブベンチマーク能力において系統的な低下は見られない。真の能力劣化であれば、通常は複数次元が同時に低下するはずであり、単一次元の極端な変動にとどまることは稀である。

利用者への影響

コード実行に大きく依存する開発チームは警戒が必要だ。Smokeベンチマークにおけるコード実行の2問での失点は、実行可能なスクリプトの生成や複数ファイルのインタラクション処理において、モデル出力の安定性が断続的に低下する可能性を示している。資料制約次元のスコアは回復しているため、厳密な出典引用が求められるドキュメント生成シーンへの影響は限定的と考えられる。

モデル選定を検討する企業にとって、GPT-5.5はエンジニアリング判断次元で継続して満点を維持しており、高い一貫性が求められる判断タスクに適している。タスク表現次元が100.00点に達したことから、構造化出力の生成や多ターン対話のシナリオにも適している。

戦略的評価

今回の総合スコア下落は、1日単位の出題変動による影響を主に反映したものであり、モデル能力の系統的な劣化ではない。コード実行次元の28点という下落幅は通常の変動範囲を超えており、次回のSmokeベンチマーク評価においても当該次元のスコアを継続して追跡することを推奨する。コード実行スコアが2日連続で85点を下回った場合は、10問以上の長期サイクルによる評価を実施し、実際の安定性を検証する必要がある。

現時点のデータは、GPT-5.5の総合能力を低く評価する根拠を支持しない。資料制約とタスク表現の各次元が同時に上昇していることから、モデルは制約遵守と表現の明瞭さにおいて依然として優位性を持つ。開発者は引き続き利用可能だが、コード実行が集中するシナリオでは人によるレビュー工程を追加することを推奨する。


データ出典:YZ Index | Run #340 | 元データを見る