GPT-5.5のコード実行スコアが22点急落、素材制約は25.9点急上昇

GPT-5.5は本日のSmoke評価テストにおいて、コード実行スコアが72.00から50.00へ低下し、素材制約スコアが69.10から95.00へ上昇した。主要ランキングの総合スコアは70.70から70.25へと変動した。

各次元スコアの具体的な変化

コード実行次元は1日で22点下落し、素材制約次元は1日で25.9点上昇した。タスク表現次元は8.3点下落し、エンジニアリング判断次元は100.00のまま変わらなかった。主要ランキングはコード実行と素材制約を加重合算したもので、最終的な低下幅はわずか0.5点にとどまった。

変動要因の分析

Smoke評価テストは1日あたり10問のみで、1つの次元につき2問が割り当てられる。コード実行と素材制約という2つのコア次元が同時に20点を超える逆方向の変動を示したことは、出題抽選のランダム性に起因する可能性が最も高い。コード実行の問題では多段階デバッグや複雑なAPI呼び出しを要するケースが抽選され、素材制約の問題ではプロンプトの境界を厳守することが求められるケースが抽選されたと考えられる。エンジニアリング判断とタスク表現のスコア変動幅が比較的小さいことも、今回の変動が抽選感度の高い2つの次元に集中していることを裏付けている。

モデルに真の性能劣化が生じた場合、通常は複数の次元に同時に影響が及ぶか、主要ランキングにより大きな低下が生じる。今回の主要ランキングの低下はわずか0.5点であり、2つの次元のスコア変化が加重処理によってほぼ相殺されたことを示しており、システム的な能力低下の証拠は現時点では確認されない。

利用者への実際的な意味

コード実行に強く依存しているチームが本日および短期間にGPT-5.5を使用する際は、生成されたコードの正確性と実行可能性を追加で検証する必要がある。素材制約スコアが大幅に上昇したポジティブな影響は、主に書式・文字数・引用ルールの厳守が求められるシナリオ、たとえば契約条項の生成や書式化されたレポート出力などに現れる。

コードと素材制約の両方を必要とする混合タスクについては、GPT-5.5の本日のパフォーマンスは前日水準に近く、主要ランキング70.25点は引き続き実用可能な範囲にある。開発者は引き続き利用できるが、コード実行結果については手動または自動テストの工程を追加することを推奨する。

戦略的判断

今回のデータが示す最も直接的なシグナルは、Smoke評価テストの1日単位の変動が主要ランキングへ与える影響は限定的であるということだ。コード実行50.00点と素材制約95.00点の組み合わせは、加重処理後も主要ランキング70.25点を維持しており、2つの次元の相補性が比較的強いことを示している。次回の評価テストでは、コード実行が65点以上に回復するか、または素材制約が80点以下に戻るかを観察し、今回が孤立した抽選イベントであったかどうかを判断する必要がある。

エンジニアリング判断が満点を維持し、誠実性評価がpassを維持していることは、モデルの基礎能力と出力規範に問題が生じていないことを示している。現在のデータはGPT-5.5の総合能力を下方修正する根拠とはならず、コード実行次元についてのみ短期的な観察を継続する必要がある。


データ出典:YZ Index | Run #354 | 元データを見る