Qwen3 Maxが84.51点で首位:2026-09-30 YZ Index Smoke速報データブリーフィング

2026-09-30のYZ Index Smoke速測は10モデルをカバーし、Qwen3 Maxが84.51点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適しているが、Fullの週次ランキングと同等の結論を意味するものではない。

今回のSmoke評価はコード実行と素材制約の2つの主要ランキング次元のみをカバーしており、主要ランキングの算式は0.55 × コード実行 + 0.45 × 素材制約である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な評価ではなく、モニタリングシグナルとして活用することが適切である。

当日ランキング

順位モデル主要スコアコード実行素材制約誠実性
#1Qwen3 Max84.519472.9pass
#2Claude Sonnet 4.679.419757.9pass
#3Claude Opus 4.777.857285pass
#4GPT-o376.867282.8pass
#5Gemini 3.1 Pro73.1755.395pass
#6GPT-5.570.77269.1pass
#7Doubao Pro70.527268.7pass
#8Grok 468.816375.9pass
#9Gemini 2.5 Pro63.915080.9pass
#10DeepSeek V4 Pro57.122100pass

データ解説

当日の主要ランキング上位3位のうち、Qwen3 Maxはコード実行94・素材制約72.9の組み合わせで84.51を獲得し、Claude Sonnet 4.6はコード実行97の高スコアを活かして素材制約57.9ながら79.41を達成し、Claude Opus 4.7はコード実行72の構成で素材制約85により77.85を獲得した。これはトップモデルが2次元の強弱においてそれぞれ異なる傾向を持つことを示している。Gemini 3.1 Proは素材制約95を支えに主要スコア73.17を記録し、一方DeepSeek V4 Proは素材制約100に対してコード実行がわずか22にとどまり、Smokeテストにおける各モデルの即時パフォーマンスの差異が浮き彫りになった。

Gemini 2.5 Proは主要スコアが22.7上昇・コード実行が25上昇・素材制約が19.9上昇し、Claude Sonnet 4.6は主要スコアが13.1上昇・コード実行が10上昇・素材制約が16.9上昇し、GPT-5.5は主要スコアが9.5下落・コード実行が28下落・素材制約が13.1上昇した。これらの変動は小サンプルという特性を踏まえて解釈する必要がある。Claude Opus 4.7のコード実行が28急落、GPT-o3のコード実行が21.8急落、Doubao Proのコード実行が24.9急落、Grok 4のコード実行が31.5急落した点については、問題のサンプリング変動または単日のパフォーマンス変動に起因する可能性がある。GLM-4.6はAPIの障害によりデータが不完全なため再実行に入っており、今回はランキングに参加しない。

Smoke速測は毎日の小サンプルによる単日シグナルであり、上記のスコア構成および変動はいずれも後続の同一条件での実行による再確認が必要であり、今日のデータを超えたモデルの真の能力に関する推断を行わないよう注意されたい。

主な変動

  • Gemini 2.5 Pro:主要スコア+22.7点、コード実行+25点、素材制約+19.9点
  • Gemini 3.1 Pro:主要スコア+18.2点、コード実行+5.3点、素材制約+34点
  • Claude Sonnet 4.6:主要スコア+13.1点、コード実行+10点、素材制約+16.9点
  • DeepSeek V4 Pro:主要スコア+11.4点、素材制約+29点、誠実性 warn→pass
  • GPT-5.5:主要スコア-9.5点、コード実行-28点、素材制約+13.1点

注目すべきシグナル

  • Claude Opus 4.7:コード実行が急落 -28点
  • GPT-o3:コード実行が急落 -21.8点
  • GPT-5.5:主要スコアが急落 -9.5点
  • Doubao Pro:コード実行が急落 -24.9点
  • Grok 4:コード実行が急落 -31.5点
  • GLM-4.6:データ不完全(コード実行・判定次元が欠落、API障害/タイムアウト)、自動再実行中のため今回はランキングに参加しない

このようなSmoke速報を読む際は、2つの点に注目すべきである。第一に、あるモデルが複数日にわたって同種の弱点を示し続けているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行スコアや素材制約スコアの大幅な変動は、問題のサンプリングによるものである可能性もあれば、真の性能劣化の初期シグナルである可能性もあり、後続の実行による再確認が必要である。


データ出典:YZ Index | Run #345 | 元データを見る