Gemini 3.1 Proが100点で首位:2026-07-28 Smokeクイックテストデータ速報

2026-07-28 YZ Index Smokeクイックテストは11モデルをカバーし、Gemini 3.1 Proが100点で当日首位となった。Smokeは毎日10問のクイックテストであり、短期シグナルの観察に適しているが、Fullウィークリーランキングの結論とは同一ではない。

今回のSmokeテストはコード実行と資料制約の2つの主要次元のみをカバーしており、主要スコアの計算式は 0.55 × コード実行 + 0.45 × 資料制約 となっている。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価ではなく、モニタリングシグナルとして活用するのが適切である。

当日ランキング

順位モデル主要スコアコード実行資料制約誠実性
#1Gemini 3.1 Pro100100100pass
#2GPT-o397.7510095pass
#3GPT-5.593.6610085.9pass
#4Doubao Pro92.0795.887.5pass
#5Grok 484.4783.385.9pass
#6DeepSeek V4 Pro847595pass
#7Claude Sonnet 4.679.917585.9pass
#8Gemini 2.5 Pro77.670.885.9pass
#9GLM-4.677.670.885.9pass
#10Qwen3 Max59.2837.585.9pass
#11Claude Opus 4.756.52595pass

データ解説

Gemini 3.1 Proは主要スコア100・コード実行100・資料制約100で首位となり、コード実行と資料制約がバランス良く高水準にある点が特徴的だ。GPT-o3は主要スコア97.75、コード実行100、資料制約95で、コード実行が資料制約を上回る。GPT-5.5は主要スコア93.66、コード実行100、資料制約85.9で、同様にコード実行が主な得点源となっている。Doubao Proは主要スコア92.07、コード実行95.8、資料制約87.5と比較的バランスの取れた構成だ。

変動面では、Gemini 3.1 Proが主要スコア+11点、資料制約+20.7点と資料制約の向上が全体を牽引した。Grok 4は主要スコア+9.3点・資料制約+15.7点、GPT-5.5は主要スコア+7.4点・資料制約+12.7点、Doubao Proは主要スコア+7.1点・資料制約+17.3点と、いずれも資料制約スコアの顕著な上昇が見られた。

異常シグナルとして、DeepSeek V4 Proのコード実行が-25点、Claude Sonnet 4.6のコード実行が-22点、Gemini 2.5 Proのコード実行が-25点、Qwen3 Maxのコード実行が-22点と急落し、Claude Opus 4.7の主要スコアも-9.5点と急落した。これらの変化は問題のサンプリングばらつきによるものか、あるいは実際の性能低下の初期シグナルである可能性があり、後続テストでの確認が必要だ。Smokeは小サンプルの単日シグナルであるため、解釈は慎重に行うべきである。

主な変化

  • Gemini 3.1 Pro:主要スコア+11点、資料制約+20.7点
  • Claude Opus 4.7:主要スコア-9.5点、コード実行-22点、資料制約+5.7点
  • Grok 4:主要スコア+9.3点、資料制約+15.7点
  • GPT-5.5:主要スコア+7.4点、資料制約+12.7点
  • Doubao Pro:主要スコア+7.1点、資料制約+17.3点

注目すべきシグナル

  • DeepSeek V4 Pro:コード実行が-25点と急落
  • Claude Sonnet 4.6:コード実行が-22点と急落
  • Gemini 2.5 Pro:コード実行が-25点と急落
  • Qwen3 Max:コード実行が-22点と急落
  • Claude Opus 4.7:主要スコアが-9.5点と急落

このようなSmoke速報を読む際には、2点に注目することが重要だ。第一に、あるモデルが複数日連続して同種の弱点を示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに変化していないかどうか。単日のコード実行または資料制約スコアの大幅な変動は、問題のサンプリングに起因する場合も、実際の性能低下の初期シグナルである場合もあり、後続テストでの確認が必要だ。


データ出典:YZ Index | Run #250 | 元データを見る