GPT-5.5のSmokeベンチマーク総合スコアが10.1点急落——資料制約スコアが1日で16.3点下落

GPT-5.5は本日のSmokeベンチマークにおいて、総合スコアが98.35点から88.27点へと下落し、降下幅は10.1点に達した。

スコア変動の内訳

コード実行次元は97.00点から92.00点へ、資料制約次元は100.00点から83.70点へとそれぞれ下落し、エンジニアリング判断次元は75.00点で変化なし、タスク表現次元は91.70点から81.70点へ下落した。総合スコアはコード実行と資料制約の2次元の加重値のみで構成されるため、資料制約における16.3点の下落が総合スコアを直接押し下げる結果となった。

考えられる原因の分析

Smokeベンチマークは1日あたり各次元2問のみを抽出するため、サンプル数が少なく、1日単位の変動は正常範囲内である。資料制約次元の下落幅が最大であったことは、当日抽出された2問の資料制約問題に、より高難度の忠実度要件やエッジケースが含まれていた可能性を示唆しており、モデルの出力が制約から逸脱したと考えられる。コード実行次元はわずか5点の下落にとどまり、比較的緩やかな変動であることから、コード関連問題の難易度分布は安定していることが伺える。エンジニアリング判断次元は変化ゼロであり、この次元が当日の問題による影響を受けにくいことを示している。タスク表現次元の10点下落は、資料制約問題に内包された表現要件が重なった影響と考えられる。

問題抽選の変動によるものか、モデルの実際の性能低下によるものかは、いずれの解釈も排除できない。現在のデータは1日の断面に過ぎず、両者を区別することはできない。今後複数日にわたって資料制約が90点を下回り続けるようであれば、実際の能力変化に近いと判断できる。一方、翌日に反発した場合は、抽選による変動である可能性が高い。

利用者への示唆

コード実行を重視するチームは、GPT-5.5の当日コード実行スコアが92.00点を維持していることに注目されたい。短期的にはコード生成補助として引き続き活用できるが、5点前後の変動リスクに備えて人的検証のプロセスを追加することが望ましい。契約書からの情報抽出やナレッジベースQ&Aなど、資料への忠実度が求められる場面では、資料制約スコア83.70点という結果は制約からの逸脱リスクが高まっていることを意味し、運用プロセスに二次検証やフォールバック機能を組み込むことを推奨する。

エンジニアリング判断次元は75.00点で安定しており、このサブスコアに依存するアーキテクチャ意思決定の場面への影響は限定的である。タスク表現次元81.70点は、出力構造を維持するためにより明確なプロンプトエンジニアリングが必要であることを示している。

戦略的判断

1日のデータに基づく評価として、GPT-5.5の総合スコアは当日の資料制約問題によって増幅された面があり、現在の88.27点は通常水準を過小評価している可能性もあるが、実際の変動を反映している可能性もある。次回の評価では、資料制約次元が95点以上に回復するかどうかを重点的に検証することを推奨する。資料制約が2日連続で85点を下回る場合は、高制約シナリオにおける優先度を見直す必要がある。

エンジニアリング判断が変化なしであることは、このサブスコア次元におけるモデルの能力が比較的安定していることを示しており、比較基準として活用できる。総じて、今回の下落は資料制約の単一次元によって主導されたものであり、複数次元にわたる系統的な性能低下のシグナルには至っていない。

資料制約が100.00点から83.70点へと下落したことが、今回の総合スコア急落の核心的な要因である。

GPT-5.5に依存する開発者への短期的な対策として、資料制約関連のテストケースのカバレッジ密度を高め、3日連続のスコア標準偏差を観察することを推奨する。標準偏差が8点を超えた場合、安定性次元はさらに圧力を受けることになる。

今回のSmokeベンチマーク結果は、GPT-5.5が資料制約次元において顕著な1日単位の変動を示した一方、コード実行次元は比較的堅調であることを示している。企業が導入を検討する際は、総合スコアの平均値のみを参照するのではなく、資料制約を独立した監視指標として位置づけるべきである。


データ提供:YZ Index | Run #286 | 元データを見る