Gemini 2.5 Pro が87.21点で首位:2026年8月7日 YZ Index Smoke クイックテスト データブリーフ

2026年8月7日のYZ Index Smokeクイックテストは9モデルを対象に実施され、Gemini 2.5 Proが87.21点で当日首位となった。Smokeは1日10問のクイックテストであり、短期シグナルの観察に適しているが、フル週間ランキングの結論とは同一視できない。

今回のSmokeテストはコード実行とマテリアル制約の2つのメインランキング次元のみをカバーしており、メインランキングの算出式は0.55 × コード実行 + 0.45 × マテリアル制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価よりも、監視シグナルとして活用するほうが適切である。

当日ランキング

順位モデルメインコード実行マテリアル制約誠実性
#1Gemini 2.5 Pro87.2194.578.3pass
#2Grok 481.2394.565warn
#3Claude Opus 4.780.9869.595pass
#4GPT-5.574.4894.550pass
#5GPT-o372.3694.545.3pass
#6Claude Sonnet 4.671.4694.543.3pass
#7Gemini 3.1 Pro67.5971.163.3pass
#8Qwen3 Max65.2369.560pass
#9DeepSeek V4 Pro61.2269.551.1pass

データ解説

本日のデータでは、Gemini 2.5 Proがメイン87.21点でトップとなり、コード実行94.5とマテリアル制約78.3のバランスが取れた結果となった。Grok 4はコード実行94.5に対しマテリアル制約65でメイン81.23、Claude Opus 4.7はマテリアル制約95に対しコード実行69.5でメイン80.98となった。GPT-5.5はコード実行94.5、マテリアル制約50でメイン74.48となり、上位モデルが2つの次元において異なる傾向を示していることが確認できる。

顕著な変化としては、DeepSeek V4 Proのメインが31点低下、コード実行が30.5点低下、マテリアル制約が31.5点低下した。Claude Sonnet 4.6はメインが20.7点低下、マテリアル制約が39.3点低下した。一方、Gemini 2.5 Proはメインが15.9点上昇、コード実行が23.7点上昇した。Qwen3 Maxはメインが15.3点低下、コード実行が18点低下した。

異常シグナルとしては、Grok 4のマテリアル制約が17.6点急落、Claude Opus 4.7のコード実行が30.5点急落、GPT-5.5のメインが12.9点急落などが挙げられる。これらは問題のサンプリングによるばらつき、または実際の性能低下の初期シグナルである可能性があり、後続の再テストによる確認が必要である。Smokeクイックテストは小規模サンプルによる単日シグナルであり、変化の解釈には慎重さが求められる。

主な変化

  • DeepSeek V4 Pro:メイン -31点、コード実行 -30.5点、マテリアル制約 -31.5点
  • Claude Sonnet 4.6:メイン -20.7点、コード実行 -5.5点、マテリアル制約 -39.3点
  • GPT-o3:メイン -16.8点、コード実行 -5.5点、マテリアル制約 -30.7点
  • Gemini 2.5 Pro:メイン +15.9点、コード実行 +23.7点、マテリアル制約 +6.4点
  • Qwen3 Max:メイン -15.3点、コード実行 -18点、マテリアル制約 -11.9点

注目すべきシグナル

  • Grok 4:マテリアル制約が急落 -17.6点
  • Claude Opus 4.7:コード実行が急落 -30.5点
  • GPT-5.5:メインが急落 -12.9点
  • GPT-o3:メインが急落 -16.8点
  • Claude Sonnet 4.6:メインが急落 -20.7点
  • Qwen3 Max:メインが急落 -15.3点
  • DeepSeek V4 Pro:メインが急落 -31点
  • Doubao Pro:データ不完全(複数次元においてAPI障害・タイムアウトのため欠損)、自動再実行中のため本期のランキング対象外
  • GLM-4.6:データ不完全(複数次元においてAPI障害・タイムアウトのため欠損)、自動再実行中のため本期のランキング対象外

このようなSmokeブリーフを読む際は、2つの点に注目すべきである。第一に、あるモデルが複数日にわたって同種の弱点を露呈し続けているかどうか。第二に、誠実性評価がpassからwarnまたはfailに変化していないかどうか。コード実行やマテリアル制約スコアの単日における大幅な変動は、問題のサンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである場合もあり、後続の再テストによる確認が必要である。


データ出典:YZ Index | Run #266 | 元データを見る