Gemini 3.1 Proが98.35点で首位:2026-09-10 YZ Index Smoke速報データブリーフィング

2026-09-10 YZ Index Smoke速測は10モデルを対象とし、Gemini 3.1 Proが98.35点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適しており、Fullウィークリーランキングの結論とは同一ではない。

今回のSmoke評価はコード実行と材料制約の2つのメインランキング次元のみをカバーし、メインランキングの計算式は 0.55 × コード実行 + 0.45 × 材料制約 である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な判断よりも、モニタリングシグナルとして参照するのが適切である。

当日ランキング

順位モデルメインランキングコード実行材料制約誠実性
#1Gemini 3.1 Pro98.3597100pass
#2Doubao Pro94.4591.797.8pass
#3Grok 493.7988.7100pass
#4Gemini 2.5 Pro88.7510075pass
#5DeepSeek V4 Pro86.2575100pass
#6GPT-5.584.672100pass
#7GPT-o378.1369.888.3pass
#8Claude Opus 4.773.9352.6100pass
#9Claude Sonnet 4.673.357275pass
#10Qwen3 Max71.3470.872pass

データ解説

本日のYZ Index Smoke速測では、Gemini 3.1 Proがメインランキング98.35で首位となり、コード実行97・材料制約100というバランスの取れた高水準の組み合わせを示した。Doubao Proはメインランキング94.45・コード実行91.7・材料制約97.8で続き、Grok 4はメインランキング93.79・コード実行88.7・材料制約100と材料制約満点の強みを見せた。Gemini 2.5 Proはメインランキング88.75・コード実行100ながら材料制約75、DeepSeek V4 Proはメインランキング86.25・コード実行75・材料制約100と材料制約主導の構造的特徴を示した。

前回同条件の実行と比較すると、Gemini 3.1 Proはメインランキング+24.1点・コード実行+20.5点・材料制約+28.6点、Gemini 2.5 Proはメインランキング+15.2点・コード実行+30.5点、DeepSeek V4 Proはメインランキング+9.8点・コード実行+5.5点・材料制約+15点と、上位モデルがコード実行と材料制約の両次元で同時に向上していることが示された。一方、Claude Sonnet 4.6はメインランキング-8.5点・コード実行-22.5点・材料制約+8.6点、GPT-o3はメインランキング-7.9点・コード実行-24.7点・材料制約+12.6点と、異常シグナルがコード実行の急落に集中している。

GPT-5.5のコード実行急落-22.5点、GPT-o3のコード実行急落-24.7点、Claude Opus 4.7のコード実行急落-16.9点、Claude Sonnet 4.6のメインランキング急落-8.5点は、問題サンプリングの変動に起因する可能性もあれば、実際の性能低下の初期シグナルである可能性もあり、後続の実行による確認が必要である。GLM-4.6はデータ不完全のためランキング対象外となった。Smokeは小サンプルの単日シグナルであり、上記の変動は当日の観察として参照されたい。

主な変動

  • Gemini 3.1 Pro:メインランキング+24.1点、コード実行+20.5点、材料制約+28.6点
  • Gemini 2.5 Pro:メインランキング+15.2点、コード実行+30.5点
  • DeepSeek V4 Pro:メインランキング+9.8点、コード実行+5.5点、材料制約+15点
  • Claude Sonnet 4.6:メインランキング-8.5点、コード実行-22.5点、材料制約+8.6点
  • GPT-o3:メインランキング-7.9点、コード実行-24.7点、材料制約+12.6点

注目すべきシグナル

  • GPT-5.5:コード実行急落 -22.5点
  • GPT-o3:コード実行急落 -24.7点
  • Claude Opus 4.7:コード実行急落 -16.9点
  • Claude Sonnet 4.6:メインランキング急落 -8.5点
  • GLM-4.6:データ不完全(複数次元でAPI障害・タイムアウトが発生)のため自動再実行待ちとなり、今回はランキング対象外

このようなSmoke速報を読む際には、2点に重点を置くべきである。第一に、あるモデルが複数日連続して同種の弱点を示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに変化していないかどうか。単日のコード実行や材料制約スコアの大幅な変動は、問題サンプリングに起因する場合も、実際の性能低下の初期シグナルである場合もあり、後続の実行による確認が必要である。


データ提供:YZ Index | Run #317 | 元データを見る