GPT-5.5は本日のSmokeベンチマーク評価において、メインランキングのスコアが86.50点から76.44点へと10.1点下落した。
スコア比較データ
コード実行次元は昨日100.00点・本日75.00点で25点の下落。素材制約次元は昨日70.00点・本日78.20点で8.2点の上昇。エンジニアリング判断(サブランキング、AI補助評価)は50.00点から100.00点に上昇。タスク表現(サブランキング、AI補助評価)は91.70点から90.00点へわずかに下落。誠実性評価はpassを維持。
データの分解分析
メインランキングはコード実行と素材制約という2つの監査可能な次元で構成される。本日のメインランキング76.44点は、コード実行75.00点と素材制約78.20点の加重平均から直接算出されている。コード実行単次元の25点下落がメインランキング下落の唯一の要因であり、素材制約の8.2点回復はその損失を部分的にしか相殺できていない。
原因分析
Smokeベンチマークは1日あたり各次元2問のみで、サンプル数が極めて少ない。コード実行が100.00点から75.00点へ下落した最も可能性の高い原因は、本日抽選された2問の難易度が昨日より高かったことであり、その結果モデルの当該次元スコアに大幅なばらつきが生じたと考えられる。素材制約スコアの8.2点上昇も同様に問題抽選の差異を示しており、モデル能力の系統的な変化ではない。エンジニアリング判断が50.00点から100.00点へ上昇したことも、単日の問題ランダム性がサブランキングに与える影響をさらに裏付けている。
真の性能劣化と問題ばらつきを区別するには、連続した複数日のデータが必要である。現時点では単日比較のみであり、コード実行におけるモデル能力が構造的に低下したかどうかは確認できない。誠実性評価がpassを維持していることは、モデルの回答に誠実性の面での問題が生じていないことを示している。
利用者への示唆
コード実行を重視するチームは、GPT-5.5が当該次元において単日で25点規模のスコアばらつきが生じうることに注意する必要がある。モデルによる信頼性の高いコード生成に依存する開発者は、人的レビューのプロセスを追加し、本日の75.00点のパフォーマンスを常態とみなさないようにすべきである。素材制約が78.20点へ上昇したことは、モデルに入力制約を厳格に遵守させる必要があるシナリオにとって一定の緩衝材となる。
エンジニアリング判断が100.00点へ上昇したことは、モデルによるエンジニアリング意思決定支援を必要とするシナリオにとってポジティブなシグナルとなるが、当該次元はサブランキングであり、AI補助評価の結果は参考情報にとどまる。
戦略的判断
今回のメインランキング10.1点下落は主にコード実行次元の25点下落によって引き起こされており、Smokeベンチマークの1日あたり10問という特性を考慮すると、今回の変化はモデルの真の性能劣化ではなく、問題抽選のばらつきによるものである可能性が高いと判断される。次回の評価ではコード実行次元が90点以上に回復するかどうかを重点的に観察する必要がある。コード実行スコアが2日連続で80点を下回る場合は、そのシグナルを潜在的な能力変化として記録する必要がある。
素材制約次元78.20点とエンジニアリング判断100.00点の組み合わせは、GPT-5.5が制約遵守とエンジニアリング判断において引き続き有用であることを示している。モデル選定を検討する企業は、GPT-5.5をマルチモデル構成の一要素として引き続き維持することができるが、純粋なコード生成タスクにおけるウェイトは引き下げるべきである。
データ出典:YZ Index | Run #332 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接