GPT-5.5が86.25点で首位:2026年9月25日 YZ Index Smoke 速報データブリーフ

2026年9月25日のYZ Index Smoke速測は10モデルを対象に実施され、GPT-5.5が86.25点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適しており、Fullウィークリーランキングの結論とは同等ではない。

今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの算出式は 0.55 × コード実行 + 0.45 × 資料制約 である。日々のサンプル数が少ないため、単日スコアはモデル能力の長期的な結論としてではなく、モニタリングシグナルとして活用するのが適切である。

当日ランキング

順位モデルメインランキングコード実行資料制約誠実性
#1GPT-5.586.2575100pass
#2Claude Opus 4.786.0374.6100pass
#3Gemini 3.1 Pro81.6966.7100pass
#4Doubao Pro76.9666.789.5pass
#5GPT-o372.550100pass
#6DeepSeek V4 Pro67.9441.7100pass
#7Claude Sonnet 4.667.785089.5pass
#8Gemini 2.5 Pro67.785089.5pass
#9Grok 461.255075pass
#10Qwen3 Max60.2148.175pass

データ解説

本日のYZ Index Smoke速測において、上位モデルはコード実行と資料制約の組み合わせで明確な差異が見られた。GPT-5.5はメインランキング86.25で首位に立ち、コード実行75・資料制約100を記録。Claude Opus 4.7がメインランキング86.03で僅差の2位となり、コード実行74.6・資料制約100。Gemini 3.1 Proはメインランキング81.69、コード実行66.7・資料制約100であった。この3モデルはいずれも資料制約次元で満点を獲得しており、コード実行スコアに差が開いたことから、高い資料制約スコアがメインランキング順位を支える効果が示されている。Doubao Proはメインランキング76.96、コード実行66.7・資料制約89.5で、資料制約の優位性によって中位を維持した。

前回の同条件runと比較すると、Grok 4はメインランキングが21.1点下落し、コード実行が45.8点低下・資料制約が9.1点上昇。DeepSeek V4 Proはメインランキングが11.4点下落し、コード実行が58.3点低下・資料制約が45.9点上昇。Gemini 2.5 Proはメインランキングが10.4点下落し、コード実行が45.8点低下・資料制約が32.8点上昇した。これらの変動は問題のサンプリングによるばらつきから生じた可能性もあれば、単日における実際のパフォーマンス差を反映している可能性もあり、後続runでの検証が必要である。Claude Sonnet 4.6はメインランキングが15.9点上昇し、資料制約が35.4点上昇。GPT-5.5はメインランキングが15.4点上昇し、資料制約が34.2点上昇したが、これらも複数回のデータによる安定性の検証が必要である。

Smoke速測は小サンプルの単日シグナルであり、現時点で異常シグナルの記録はなく、解釈は本日のデータ構造分析に限定し、長期的な推論は行わない。

主な変動

  • Grok 4:メインランキング21.1点下落、コード実行-45.8点、資料制約+9.1点
  • Claude Sonnet 4.6:メインランキング15.9点上昇、資料制約+35.4点
  • GPT-5.5:メインランキング15.4点上昇、資料制約+34.2点
  • DeepSeek V4 Pro:メインランキング11.4点下落、コード実行-58.3点、資料制約+45.9点
  • Gemini 2.5 Pro:メインランキング10.4点下落、コード実行-45.8点、資料制約+32.8点

注目すべきシグナル

  • 今回、公開可能な異常シグナルは記録されていない。

このようなSmoke速報を読む際は、2点に重点を置くべきである。第一に、あるモデルが複数日連続して同種の弱点を露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行していないかどうか。単日のコード実行または制約スコアの大幅な変動は、問題のサンプリングによるものである場合も、実際の性能低下の早期シグナルである場合もあり、後続runによる検証が必要である。


データ出典:YZ Index | Run #338 | 元データを見る