Claude Opus 4.7とGPT-5.5が86.5点で同率首位:2026-07-30 YZ Index Smoke速報データブリーフィング

2026-07-30 YZ Index Smokeテストは11モデルをカバーし、Claude Opus 4.7とGPT-5.5が86.5点で当日の同率首位となった。Smokeは毎日10問の速報テストであり、短期シグナルの観察に適しているが、Full週次ランキングの結論とは同等ではない。

今回のSmoke評価はコード実行と資料制約の2つの主要ランキング次元のみをカバーしており、主要ランキングの算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価よりも、モニタリングシグナルとして活用するのが適切である。

当日ランキング

順位モデル主要スコアコード実行資料制約誠実性
#1Claude Opus 4.786.510070pass
#2GPT-5.586.510070pass
#3GPT-o379.917585.9pass
#4Claude Sonnet 4.678.8696.956.8pass
#5Grok 478.019260.9pass
#6DeepSeek V4 Pro76.857579.1pass
#7Doubao Pro757575pass
#8Gemini 3.1 Pro72.757570pass
#9Gemini 2.5 Pro60.7973.745pass
#10Qwen3 Max60.5554.767.7pass
#11GLM-4.639.565026.8pass

主な変動

  • GPT-5.5:主要スコア+19.8点、コード実行+25点、資料制約+13.5点
  • Grok 4:主要スコア-11.3点、コード実行-5.8点、資料制約-18点
  • Claude Opus 4.7:主要スコア+9.7点、コード実行+25点、資料制約-8.9点
  • Claude Sonnet 4.6:主要スコア+8.1点、コード実行+21.9点、資料制約-8.8点
  • Qwen3 Max:主要スコア-7.5点、コード実行-17.8点、資料制約+5.1点

注目すべきシグナル

  • Grok 4:主要スコアが急落 -11.3点
  • DeepSeek V4 Pro:コード実行が急落 -25点
  • Doubao Pro:コード実行が急落 -22点
  • Gemini 2.5 Pro:資料制約が急落 -24.8点
  • Qwen3 Max:コード実行が急落 -17.8点
  • GLM-4.6:資料制約が急落 -40.7点

このようなSmoke速報を読む際は、2点に注目すべきである。第一に、あるモデルが複数日連続して同種の弱点を示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailへ移行していないかどうか。単日のコード実行スコアや資料制約スコアの大幅な変動は、問題のサンプリングによるものである可能性もあるが、実際の性能劣化の初期シグナルである可能性もあり、後続の実行での検証が必要である。


データ出典:YZ Index | Run #254 | 元データを見る