GPT-o3が96.01点で首位:2026-09-22 YZ Index Smoke速報データブリーフィング

2026-09-22のYZ Index Smoke速測では10モデルを対象に評価が実施され、GPT-o3が96.01点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期的なシグナルの観察に適しており、Fullウィーク総合ランキングの結論とは同一ではない。

今回のSmoke評価はコード実行と資料制約の2つの主要ランキング指標のみを対象としており、主要ランキングの算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な結論としてではなく、モニタリングシグナルとして活用することが適切である。

当日ランキング

順位モデル総合スコアコード実行資料制約誠実性
#1GPT-o396.019794.8pass
#2Claude Sonnet 4.691.249784.2pass
#3Claude Opus 4.791.159784pass
#4Grok 490.8696.384.2pass
#5Doubao Pro90.7796.384pass
#6GPT-5.586.169772.9pass
#7Gemini 3.1 Pro79.2996.358.5pass
#8Qwen3 Max78.447286.3pass
#9Gemini 2.5 Pro72.57273.1pass
#10DeepSeek V4 Pro66.027258.7pass

データ解説

本日のYZ Index Smoke速測において、GPT-o3はコード実行97・資料制約94.8という高水準の組み合わせにより総合スコア96.01を記録し、首位を獲得した。重み0.55と0.45のもとでの総合パフォーマンスは際立っている。Claude Sonnet 4.6とClaude Opus 4.7も同じくコード実行97を記録したが、資料制約はそれぞれ84.2と84にとどまり、総合スコアは91.24と91.15で2位・3位となった。Grok 4とDoubao Proはコード実行96.3・資料制約84.2および84でこれに続く。Qwen3 Maxはコード実行72・資料制約86.3という相補的な構造を示し、総合スコアは78.44となった。

変動の大きいモデルとして、DeepSeek V4 Proは総合スコア66.02と前回比29点下落し、コード実行と資料制約もそれぞれ28点・30.2点の同時下落となった。Claude Opus 4.7は総合スコアが20.4点上昇し、主にコード実行の41.4点増加によるものである。Claude Sonnet 4.6はコード実行が47点増加し、総合スコアが18.7点上昇した。Gemini 3.1 Proは総合スコアが15.9点下落し、資料制約が30.8点下落した。GPT-o3は総合スコアが14.6点上昇し、コード実行が22点増加した。

異常シグナルとして、Claude Sonnet 4.6とGrok 4の資料制約がともに15.8点下落し、Gemini 2.5 Proの総合スコアが13.1点下落、DeepSeek V4 Proの総合スコアが29点下落した。これらの変化は問題のサンプリング変動によるものである可能性もあれば、実際の性能低下の早期シグナルである可能性もあり、後続の実行による検証が必要である。Smokeは小サンプルの単日シグナルであり、現時点のデータは参考情報として扱われたい。

主な変化

  • DeepSeek V4 Pro:総合スコア-29点、コード実行-28点、資料制約-30.2点
  • Claude Opus 4.7:総合スコア+20.4点、コード実行+41.4点、資料制約-5.3点
  • Claude Sonnet 4.6:総合スコア+18.7点、コード実行+47点、資料制約-15.8点
  • Gemini 3.1 Pro:総合スコア-15.9点、資料制約-30.8点
  • GPT-o3:総合スコア+14.6点、コード実行+22点、資料制約+5.5点

注目すべきシグナル

  • Claude Sonnet 4.6:資料制約が急落 -15.8点
  • Grok 4:資料制約が急落 -15.8点
  • Gemini 3.1 Pro:総合スコアが急落 -15.9点
  • Gemini 2.5 Pro:総合スコアが急落 -13.1点
  • DeepSeek V4 Pro:総合スコアが急落 -29点
  • GLM-4.6:データ不完全(実行・制約・判定・誠実性・コミュニケーション各次元が欠損、APIエラー/タイムアウト)のため自動再実行中。本期のランキングには参加しない

このようなSmokeブリーフィングを読む際は、2点に着目することが重要である。第一に、あるモデルが同種の弱点を複数日連続して露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailへ移行しているかどうか。単日のコード実行スコアや資料制約スコアの大幅な変化は、問題のサンプリングに起因する場合もあれば、実際の性能低下の早期シグナルである場合もあり、後続の実行による検証が必要である。


データ出典:YZ Index | Run #334 | 元データを見る