Claude Opus 4.7が95.08点で首位:2026-08-21 YZ Index Smoke速報データブリーフィング

2026-08-21のYZ Index Smoke速測は10モデルを対象とし、Claude Opus 4.7が95.08点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観察に適しており、Fullウィークリーランキングの結論とは同一ではない。

今回のSmoke評価はコード実行と資料制約の2つの主要ランキング次元のみを対象としており、主榜の算出式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価ではなく、モニタリングシグナルとして用いるのが適切である。

当日ランキング

順位モデル主榜コード実行資料制約誠実性
#1Claude Opus 4.795.0898.590.9pass
#2Qwen3 Max79.647585.3warn
#3Doubao Pro78.67583pass
#4Grok 476.3671.981.8pass
#5Claude Sonnet 4.672.1576.666.7pass
#6GPT-5.570.0958.384.5pass
#7DeepSeek V4 Pro68.8858.381.8pass
#8GPT-o362.4756.869.4warn
#9Gemini 3.1 Pro505050warn
#10Gemini 2.5 Pro18.3723.512.1fail

データ解説

スコア構造を見ると、Claude Opus 4.7は主榜95.08点で、コード実行98.5点と資料制約90.9点がバランスの取れた組み合わせを形成し、首位に立った。Qwen3 Maxは主榜79.64点で、コード実行75点に対して資料制約85.3点と、資料制約が相対的に強い特徴を示している。Doubao Proは主榜78.6点で、コード実行75点・資料制約83点と類似した構造を持つ。Grok 4は主榜76.36点で、コード実行71.9点・資料制約81.8点と、同様に資料制約寄りの構成となっている。

変動の大きいモデルとして、Gemini 2.5 Proは主榜が44.1点下落し、コード実行が21.5点低下、資料制約が71.6点低下、誠実性評価がpassからfailに転じた。Gemini 3.1 Proは主榜が29.5点下落し、コード実行が17点低下、資料制約が44.8点低下、誠実性がwarnに転じた。Claude Sonnet 4.6は主榜が22.5点下落し、コード実行が15.4点低下、資料制約が31.1点低下した。GPT-o3は主榜が22.2点下落し、コード実行が19.5点低下、資料制約が25.4点低下、誠実性がwarnに転じた。GPT-5.5は主榜が18.2点下落し、コード実行が33.7点低下した。これらの変化は問題のサンプリングによる変動である可能性もあれば、実際の性能劣化を示している可能性もあり、後続のrunによる再確認が必要である。

Smokeテストは小サンプルの単日シグナルであり、上記の解釈は慎重に留め、長期的な結論は下さない。

主な変化

  • Gemini 2.5 Pro:主榜44.1点下落、コード実行-21.5点、資料制約-71.6点、誠実性pass→fail
  • Gemini 3.1 Pro:主榜29.5点下落、コード実行-17点、資料制約-44.8点、誠実性pass→warn
  • Claude Sonnet 4.6:主榜22.5点下落、コード実行-15.4点、資料制約-31.1点
  • GPT-o3:主榜22.2点下落、コード実行-19.5点、資料制約-25.4点、誠実性pass→warn
  • GPT-5.5:主榜18.2点下落、コード実行-33.7点

注目すべきシグナル

  • Gemini 2.5 Pro:当日の誠実性評価はfail(当日のSmokeデータに基づく)。

このようなSmoke速報を読む際は、2点に注目すべきである。第一に、あるモデルが複数日にわたって同種の弱点を示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行スコアや資料制約スコアの大幅な変動は、問題のサンプリングによるものである可能性もあれば、実際の性能劣化の早期シグナルである可能性もあり、後続のrunによる再確認が必要である。


データ出典:YZ Index | Run #288 | 元データを見る