GPT-5.5が93.16点で首位:2026-09-28 YZ Index Smoke速報データブリーフィング

2026-09-28 YZ Index Smokeの速テストは11モデルを対象とし、GPT-5.5が93.16点で当日首位となった。Smokeは毎日10問の速テストであり、短期シグナルの観測に適しており、Fullウィークリーランキングの結論とは同等ではない。

今回のSmoke評価はコード実行と資料制約の2つのメイン指標のみをカバーしており、メインスコアの計算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な結論としてではなく、モニタリングシグナルとして活用するのが適切である。

当日ランキング

順位モデルメインコード実行資料制約誠実性
#1GPT-5.593.169590.9pass
#2Claude Sonnet 4.691.8110081.8pass
#3Grok 491.8110081.8pass
#4Qwen3 Max91.7892.590.9warn
#5Claude Opus 4.782.167590.9pass
#6GPT-o380.7872.590.9pass
#7DeepSeek V4 Pro70.917565.9warn
#8Gemini 3.1 Pro68.6378.356.8pass
#9Doubao Pro68.167065.9warn
#10Gemini 2.5 Pro64.067056.8pass
#11GLM-4.651.912090.9pass

データ解説

当日メインランキング上位3位のうち、GPT-5.5はコード実行95・資料制約90.9の組み合わせで93.16点を獲得。Claude Sonnet 4.6とGrok 4はいずれもコード実行100・資料制約81.8の組み合わせで91.81点に並び、トップモデルが2つの能力において異なる強みを持つことが示された。Qwen3 Maxはコード実行92.5・資料制約90.9でメインスコア91.78と僅差で続いた。Claude Opus 4.7とGPT-o3はいずれもコード実行が低め・資料制約90.9という構成で、メインスコアはそれぞれ82.16と80.78にとどまった。

異常シグナルとして、Claude Opus 4.7のメインスコアが急落(-13.9点)、GPT-o3が急落(-15.2点)、Doubao Proが急落(-14.8点)で誠実性評価がpassからwarnに変化、GLM-4.6のコード実行が急落(-47点)といった動きが見られた。これらの単日変動は問題のサンプリングによる揺らぎに起因する可能性もあれば、実際の性能劣化を反映している可能性もあり、今後同条件での再実行による確認が必要である。Smoke速テストはサンプル数が限られており、上記の数値はあくまで当日の観測結果であり、モデル全体のパフォーマンスへの一般化には適していない。

主な変動

  • GPT-o3:メインスコア-15.2点、コード実行-24.5点
  • Doubao Pro:メインスコア-14.8点、コード実行-22点、資料制約-6.1点、誠実性 pass→warn
  • GPT-5.5:メインスコア+14.4点、コード実行+23点
  • Claude Opus 4.7:メインスコア-13.9点、コード実行-22点
  • Grok 4:メインスコア-5.8点、資料制約-13点

注目すべきシグナル

  • Claude Opus 4.7:メインスコア急落 -13.9点
  • GPT-o3:メインスコア急落 -15.2点
  • Doubao Pro:メインスコア急落 -14.8点
  • GLM-4.6:コード実行急落 -47点

このようなSmoke速報を読む際は、2つの点に重点を置くべきである。第一に、あるモデルが複数日連続して同種の弱点を示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行スコアや資料制約スコアの大幅な変動は、問題のサンプリングによるものである場合もあれば、実際の性能劣化の初期シグナルである場合もあり、今後の再実行による確認が必要である。


データ出典:YZ Index | Run #341 | 元データを見る