GPT-5.5のコード実行スコアが22.5点急落、材料制約は28.6点急騰

GPT-5.5は本日のSmoke評価テストにおいて、コード実行スコアが94.50から72.00へ22.5点下落し、材料制約スコアは71.40から100.00へ28.6点上昇した。メインランキングのスコアは84.11から84.60へのわずかな上昇にとどまった。

データの実態:2つの指標の激しい逆方向の動き

Smoke評価テストでは1日あたり各指標2問のみ出題される。コード実行指標は昨日94.50から本日72.00へ、材料制約指標は昨日71.40から本日100.00へと変動した。エンジニアリング判断は100.00のまま変化なく、タスク表現は81.70から91.70へ上昇した。誠実性評価はpassを維持。メインランキングの加重結果はわずか0.5点の上昇にとどまった。

原因分析:出題抽選による変動の可能性が高い

コード実行指標が1日で22.5点下落した主な原因として、2問のうち少なくとも1問の難易度または問題タイプの急変が考えられる。材料制約指標が同時に28.6点上昇して満点に達したことは、今回の抽選で制約遵守系の問題において高得点を取りやすい問題が選ばれたことを示している。2つの指標が同時に極端かつ逆方向に動いていることは、モデルのパラメータレベルの劣化ではなく、出題抽選のランダム性を示唆している。

真の性能劣化であれば、通常は複数の指標が同方向に下落するか、メインランキングが明確に落ち込むことが伴う。今回のメインランキングはわずか+0.5点で、エンジニアリング判断に変化がなかったことも、変動による説明をさらに裏付けている。

利用者への影響

コード実行に大きく依存するチームは、特にSmoke評価テストで単一指標の変動が20点を超えた場合、本番プロセスに人手によるチェック工程を追加する必要がある。材料制約の満点は厳密な指示遵守が求められるシナリオに有利だが、コード実行の不安定性がもたらすリスクを相殺することはできない。

開発者はモデル選定の際、単日のスコアだけでなく、コード実行指標の過去の標準偏差も考慮に入れるべきである。

戦略的判断

今回の変動は出題抽選によるものである可能性が最も高く、現時点でGPT-5.5の全体的な能力評価を下方修正する必要はない。次回のSmoke評価テストでコード実行が90点以上に回復した場合は、今回が孤立した変動であったと確認できる。80点を下回る状態が続く場合は、より長期的な安定性追跡を開始する必要がある。

現時点のデータは「モデル劣化」という判断を支持しておらず、GPT-5.5のコード実行指標を高変動項目として位置づけ、重要なタスクでは人手によるフォールバックを維持することを推奨する。


データ出典:YZ Index | Run #317 | 元データを見る