Claude Opus 4.7・GPT-5.5・GPT-o3・Grok 4が86.25点で並列首位:2026-08-16 YZ Index Smoke速報データブリーフ

2026-08-16のYZ Index Smoke速測では11モデルを対象に評価が行われ、Claude Opus 4.7、GPT-5.5、GPT-o3、Grok 4が86.25点で当日首位に並んだ。Smokeは毎日10問の速測であり、短期的なシグナルの観察に適しているが、Fullウィークリーランキングの結論とは同一ではない。

今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみを対象とし、メインランキングの計算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日のスコアはモデル能力の長期的な結論としてではなく、モニタリングシグナルとして参照するのが適切である。

当日ランキング

順位モデルメインランキングコード実行資料制約誠実性
#1Claude Opus 4.786.2575100pass
#2GPT-5.586.2575100pass
#3GPT-o386.2575100pass
#4Grok 486.2575100pass
#5Claude Sonnet 4.6757575pass
#6Qwen3 Max757575pass
#7DeepSeek V4 Pro70.4466.775pass
#8Doubao Pro70.4466.775pass
#9Gemini 3.1 Pro70.4466.775pass
#10Gemini 2.5 Pro54.3837.575pass
#11GLM-4.648.7537.562.5pass

データ解説

本日のYZ Index Smoke速測では、Claude Opus 4.7、GPT-5.5、GPT-o3、Grok 4の4モデルがメインランキングで86.25点に並んだ。これらはコード実行スコアがいずれも75点、資料制約スコアがいずれも100点であり、資料制約次元で満点を獲得しながらコード実行次元では同水準に留まるという構造的な組み合わせを示している。Claude Sonnet 4.6とQwen3 Maxはコード実行75・資料制約75でメインランキング75点を獲得。DeepSeek V4 Pro、Doubao Pro、Gemini 3.1 Proはいずれもコード実行66.7・資料制約75でメインランキング70.44点、Gemini 2.5 Proはコード実行37.5・資料制約75でメインランキング54.38点、GLM-4.6はコード実行37.5・資料制約62.5でメインランキング48.75点に対応する。

前回の同条件実施との比較では、Gemini 3.1 Proのメインランキングが28.9点上昇(コード実行+41.7点、資料制約+13.3点)、Grok 4が27.3点上昇(コード実行+25点、資料制約+30点)、Gemini 2.5 Proが23.1点上昇(コード実行+12.5点、資料制約+36.1点)、GPT-5.5がメインランキング22.2点上昇かつ資料制約+49.4点、GPT-o3がメインランキング17.2点上昇かつ資料制約+38.3点となった。一方、Claude Opus 4.7はコード実行で-24.6点、Claude Sonnet 4.6はコード実行で-25点の変化が見られた。

コード実行次元における顕著な低下は、単日の小サンプル抽出による変動に起因する可能性もあれば、特定の制約シナリオにおけるモデルの実際のパフォーマンス差を反映している可能性もあり、後続の同条件実施による再確認が必要である。Smokeは毎日の単日シグナルであり、現時点のデータは当日の構造観察にのみ適しており、長期的なトレンド判断の根拠とはならない。

主な変化

  • Gemini 3.1 Pro:メインランキング+28.9点、コード実行+41.7点、資料制約+13.3点
  • Grok 4:メインランキング+27.3点、コード実行+25点、資料制約+30点
  • Gemini 2.5 Pro:メインランキング+23.1点、コード実行+12.5点、資料制約+36.1点
  • GPT-5.5:メインランキング+22.2点、資料制約+49.4点
  • GPT-o3:メインランキング+17.2点、資料制約+38.3点

注目すべきシグナル

  • Claude Opus 4.7:コード実行が急落 -24.6点
  • Claude Sonnet 4.6:コード実行が急落 -25点

この種のSmokeブリーフを読む際は、2点に注目すべきである。第一に、あるモデルが複数日にわたって同種の弱点を露呈し続けているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行していないかどうか。単日のコード実行または資料制約スコアの大幅な変動は、問題のサンプリングに起因する場合もあれば、実際の性能劣化の初期シグナルである可能性もあり、後続の実施による再確認が必要である。


データ出典:YZ Index | Run #280 | 元データを見る