GPT-5.5のSmoke評価メインランキングが9.1点急落——資料制約が1日で16.5点下落

GPT-5.5は本日のSmoke評価において、メインランキングのスコアが95.01から85.93へと9.1点下落した。

スコア詳細と主要な変動要因

コード実行は100.00から97.00へ3点下落、資料制約は88.90から72.40へ16.5点下落した。一方、エンジニアリング判断は75.00から100.00へ25点上昇し、タスク表現は90.00のまま変化なし。メインランキングにはコード実行と資料制約の2次元のみが含まれており、資料制約の16.5点の下落がメインランキングで9.1点の純損失を直接もたらした。

出題の変動か、モデルの真の劣化か

Smoke評価は1日あたり10問・次元ごとに2問であり、1日単位の変動は本来正常な範囲内である。資料制約の失点が集中する一方でエンジニアリング判断が同日に大幅上昇したことは、当日の資料制約問題の難度が高く制約が厳しかった可能性を示しており、エンジニアリング判断問題は相対的に易しかったと考えられる。このような次元をまたぐ逆方向の変動は、モデル能力全体の劣化よりも出題抽選のランダム性に起因するパターンと符合する。コード実行の下落も3点にとどまり、変動解釈をさらに裏付けている。

利用者への具体的な影響

長文書のファクトチェック、引用生成、企業ナレッジベースQ&Aなど資料制約を重視するシナリオでは注意が必要であり、本日の72.40点は昨日の88.90点を大きく下回り、1日での実用性が明確に低下している。コード実行に依存するチームへの影響は小さく、97.00点は依然として高水準を維持している。エンジニアリング判断の100.00点は高スコアだが、これはサイドランキング(AI補助評価)に属しており、メインランキングの順位には直接影響しない。

戦略的判断

資料制約の1日16.5点の下落はすでに通常の変動閾値を超えており、次回も引き続き追跡する価値がある。次回の資料制約スコアが85点以上に回復すれば出題抽選による変動と判定できるが、80点を継続して下回る場合はこの次元におけるモデルの真の安定性低下を検討する必要がある。現時点のデータは「モデル全体の劣化」という結論を支持しておらず、「資料制約次元において異常な変動が発生した」という判断のみを支持している。

誠実性評価はpassを維持しており、参入基準上の問題は発生していない。安定性次元は今回のデータでは提供されておらず、一貫性を直接評価することはできない。


データ出典:YZ Index | Run #298 | 元データを見る