GPT-5.5は本日のSmoke評価において、メインボードスコアが82.29点から60.87点へと低下し、1日の下落幅は21.4点に達した。
主要次元スコアの比較
コード実行次元は前日の97.00点から75.00点へと22点下落し、材料制約次元は64.30点から43.60点へと20.7点低下した。エンジニアリング判断(サイドボード、AI補助評価)は100.00点のまま変動なし、タスク表現(サイドボード、AI補助評価)は91.70点から81.70点へと低下した。
データの事実と原因分析
Smoke評価は1日あたり10問のみで、各次元2問という構成であり、サンプル数が少ないため1日単位の変動は通常起こり得る。ただし今回のGPT-5.5は、メインボードの2つの次元が同時に20点以上の下落を示しており、これは典型的な抽選変動の範囲をはるかに超えている。コード実行と材料制約が揃って大幅に低下したことは、今回抽出された問題において、モデルの指示実行の正確性および与えられた材料への忠実度がともに顕著に低下したことを示している。
エンジニアリング判断次元の変動ゼロは、サイドボードのタスクにおいてモデルが依然として満点水準を維持できることを示している。タスク表現次元の低下が10点にとどまったことから、問題の主な原因はメインボードの監査可能次元に集中していると見られる。誠実性評価は「pass」を維持しており、閾値警告は発動していない。
利用者への示唆
コード実行を重視するチームは、GPT-5.5への依存度を直ちに引き下げる必要がある。特に高精度なスクリプト生成や複雑なロジック検証が求められるシナリオでは注意が必要だ。材料制約への依存度が高いシナリオ(契約審査、コードレビュー、ナレッジベースQ&Aなど)ではリスクが高まっており、43.60点という水準はモデルが与えられた材料から逸脱しやすくなっていることを意味する。
エンジニアリング判断が満点を維持している点は、意思決定支援を必要とする開発者にとって依然として参考価値があるが、メインボードの崩落により全体的な可用性は制約を受けている。
戦略的判断
今回の21.4点の下落はSmoke評価の通常変動域を超えており、次回の重点検証に値する。翌日のスコアが依然として60点前後にとどまる場合、GPT-5.5のメインボード能力に真の退行が生じた可能性がある。一方、スコアが速やかに回復した場合は、今回は典型的な小サンプル抽選イベントとみなせる。現時点のデータは、GPT-5.5を引き続き主力候補モデルとして位置づけることを支持しない。
メインボードはコード実行と材料制約のみで構成されており、この2次元が同時に崩落したことが全体ランキングの低下に直結している。エンジニアリング判断とタスク表現の相対的な安定はメインボードの欠落を補うことができない。
コード実行75.00点と材料制約43.60点から算出された60.87点のメインボードスコアは、同種の多くのモデルの日常水準を下回っている。
モデル選定を検討する企業は、今後3回のSmoke結果を優先的に観察した上で、デプロイ戦略の調整を判断すべきだ。GPT-5.5に依存する開発者は、メインボードの低位が継続する可能性に備え、代替モデルを準備しておく必要がある。
データ出典:YZ Index | Run #320 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接