GPT-5.5は本日のSmoke評価においてコード実行スコアが100.00から75.00へと低下し、メインランキング全体も79.12から71.67へと下落した。
スコア変化の事実
コード実行の次元で25ポイントの低下、資料制約は53.60から67.60へと上昇、エンジニアリング判断は100.00から75.00へと低下、タスク表現は81.70から90.00へと上昇、誠実性評価はpassを維持。メインランキングはコード実行と資料制約の加重平均で構成されており、本日の純減は7.5ポイントとなった。
考えられる原因の分析
Smoke評価は1日あたりわずか10問、次元ごとに2問であり、1問あたりの得点ウェイトが高い。コード実行とエンジニアリング判断が同時に25ポイント低下したことは、当日の抽選でコードの正確性や論理的一貫性への要求が高い問題が選ばれたことを示唆している。一方、資料制約が14ポイント上昇したことは、引用制限に関するモデルのパフォーマンスが改善されていることを示しており、全体的な能力の退行ではなく、特定次元が問題プールの抽選に影響を受けたものと考えられる。
モデルの真の退行であれば、通常は複数の次元が同時に連続して複数日にわたり低下する。現時点では単日のデータのみであり、退行傾向を確認することはできない。抽選のばらつきによる可能性が高いが、25ポイントの下落幅は日常的な小幅変動の範囲を超えている。
利用者への示唆
コード実行に強く依存する開発チームは、単日のパフォーマンス不安定に注意が必要だ。Smoke評価でコード実行75点という結果は、複雑なロジックや複数ステップの計算を含むシナリオにおいて、GPT-5.5がエラーを起こす確率が上昇していることを意味する。資料制約67.60点は、厳密な引用タスクにおいてこのモデルに依然として明確な弱点があることを示しており、忠実度の要求が高くないコンテンツ生成シナリオに適している。
エンジニアリング判断が同時に25ポイント低下したことは、モデルのアーキテクチャ判断補助やコードレビューを必要とするプロジェクトにとって直接的なリスクとなる。タスク表現が8.3ポイント上昇したことは、純粋なテキスト出力タスクへの影響は比較的小さい。
戦略的判断
今回の変化は問題抽選のばらつきによるものである可能性が最も高いが、下落幅は継続的な追跡が必要な閾値に達している。次回のSmoke評価でコード実行が85点を下回り続ける場合、当該次元においてモデルに系統的な問題が生じていることを検討する必要がある。現在のデータは「モデルが既に退行した」という結論を支持せず、「単日の変動が顕著である」という判断のみを支持する。
モデル選定を検討する企業は、GPT-5.5のコード実行パフォーマンスを毎日の監視リストに加えるべきであり、直ちにモデルを切り替えるべきではない。資料制約の改善については、安定した向上であるかどうかを後続の検証で確認する価値がある。
データ出典:YZ Index | Run #308 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接