GPT-5.5、材料制約スコアが15.2点急落・コード実行は30点上昇――総合ランキングは9.7点改善

GPT-5.5は本日のSmokeテストにおいて、材料制約スコアが昨日の65.80点から50.60点へと15.2点下落した。一方、コード実行スコアは45.00点から75.00点へと30点上昇し、総合ランキングスコアは54.36点から64.02点へと9.7点改善した。

スコア変動の概要

エンジニアリング判断スコアは75.00点から100.00点へと25点上昇し、タスク表現スコアは90.00点から81.70点へと8.3点下落した。誠実性評価は「pass」を維持した。

変動要因の分析

Smokeテストは1日あたり10問、各次元2問のみで構成されており、サンプル数が少ないため単日の変動は正常な範囲内である。材料制約とコード実行のスコアが逆方向に動いた原因は、当日の出題分布の差異によるものである可能性が最も高く、モデル能力の構造的な劣化を示すものではない。エンジニアリング判断の満点取得とタスク表現の下落も、出題の重点の変化を示唆している。

利用者への示唆

材料制約を重視する企業は、本日の50.60点という結果に注意が必要である。長文ドキュメントの処理や引用タスクにGPT-5.5を活用している開発者は、手動による検証プロセスを追加することを推奨する。コード実行を重視するチームは75.00点の優位性を短期的に活用できるが、安定性の確認には複数日にわたるデータの観察が必要である。

戦略的評価

総合ランキングスコアの上昇は主にコード実行の改善によるものであり、材料制約における15.2点の下落は小サンプルの条件下では明確な劣化シグナルとはならない。次回以降も材料制約とコード実行の推移を継続的に追跡し、下落が続く場合はさらなる検証を行うことを推奨する。

今回のテストにおける材料制約の15.2点下落とコード実行の30点上昇という逆方向の変動は、1日2問の抽選がスコアに与える影響がモデル自体の短期的な変化を上回ることを裏付けている。エンジニアリング判断が100.00点に達したことも、出題難易度の分布による説明を支持している。

材料制約が重要なシナリオにおいて、GPT-5.5の本日の50.60点という結果は引用精度の低下を示唆する可能性があり、利用者は重要な出力段階で二次確認を追加すべきである。コード実行の75.00点は、迅速なプロトタイプ検証を必要とする開発者にとって一時的な利便性をもたらす。

総合ランキング64.02点と各次元のデータを総合すると、GPT-5.5の現在のパフォーマンスに系統的な劣化は見られず、単日の材料制約スコア下落は抽選によるばらつきの結果である可能性が高い。今後のSmokeテストにおける材料制約スコアの標準偏差を継続的に監視することで、より信頼性の高い判断材料が得られるだろう。


データ出典:YZ Index | Run #279 | 元データを見る