GPT-5.5は本日のSmokeテストにおいて、コード実行スコアが94.50から69.50へと低下し、素材制約スコアが76.00から100.00へ上昇し、総合ランキングスコアが86.18から83.23へと低下した。
データの実態:二指標の相殺による小幅な低下
総合ランキングはコード実行と素材制約の2つの監査可能な次元のみで構成されている。本日はコード実行が25点低下し、素材制約が24点上昇したため、両者が相殺され、総合ランキングの純減は3点となった。エンジニアリング判断は100.00のまま変化なく、タスク表現は100.00から81.70へと低下した。誠実性評価はpassを維持している。
Smokeテストは1日あたりわずか10問で、各次元2問ずつである。1日あたりのサンプル数が極めて少ないため、1問の失敗だけで20〜30点規模の変動が生じる可能性がある。コード実行と素材制約が同時に大幅な逆方向の動きを示したことは、単一方向の系統的な性能低下ではなく、問題の抽選による変動の特徴に合致している。
原因分析:問題の抽選による変動が最も有力な説明
本日のコード実行次元での失点は集中しており、2問のうち少なくとも1問が複雑な多段計算や長連鎖依存を含んでいた可能性がある。素材制約次元が同時に満点へ上昇したことは、同一セットの問題においてモデルが指示の境界をより厳密に遵守したことを示している。同一モデル内で2つの能力が同時に極端な逆方向の変化を示したことは、モデルのパラメータやトレーニング後の更新による全体的な能力低下ではなく、問題内容の差異を示唆している。
タスク表現次元の18.3点低下はサブランキング(AI補助評価)に属するものであり、総合ランキングの計算には含まれない。この次元の変動はコード実行の低下と方向性が一致しているが、その幅は実行次元より小さく、次元をまたいだ問題の重複影響が存在する可能性を示唆している。
利用者への意味
コード実行を重視するチームがモデル選定を行う際は、1日単位の変動リスクに特別な注意を払う必要がある。Smokeテストは1次元あたりわずか2問であるため、69.50点は当日抽選された問題の難易度を反映しているに過ぎず、モデルの実際のコード能力の下限を示すものではない可能性がある。素材制約に依存するシナリオ(長い指示の遵守や厳密なフォーマット出力など)では本日の結果がむしろ良好であり、補完的な参考情報として活用できる。
開発者がコード実行と素材制約の両次元を同時に利用している場合、本日のデータは両者に一定の相補性があることを示している。総合ランキングの純減がわずか3点にとどまったことは、単一次元の急落による全体的な実用性への影響が部分的に相殺されていることを示している。
戦略的判断
本日のスコア比較に基づくと、コード実行の急落はモデルの実際の性能低下よりも問題の抽選変動によって引き起こされた可能性が高い。総合ランキングの小幅な低下は2次元の逆方向の動きというパターンと一致しており、継続的な能力低下を支持する証拠は現時点では存在しない。次回のSmokeテストでコード実行が90点以上に回復すれば、変動的な性質であることがさらに確認される。75点を継続して下回るようであれば、より大きなサンプルでの再テストを開始する必要がある。
エンジニアリング判断が満点を維持していることは、サブランキング(AI補助評価)レベルでのモデルの意思決定の一貫性が影響を受けていないことを示している。誠実性評価はpassであり、参入基準を満たしている。安定性と可用性については今回の評価データが提供されていないため、判断の対象外とする。
総合的に見ると、GPT-5.5の本日のパフォーマンスはSmokeテストの正常な範囲内における極端なサンプルに相当する。モデル選定チームはその後3〜5日間のデータを引き続き観察した上で、コード実行関連のワークフローを調整するかどうかを決定することが望ましい。
データ出典:YZ Index | Run #304 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接