Grok 4が95.44点で首位:2026年9月21日 YZ Index Smoke速報データ

2026年9月21日のWinzheng YZ Index Smoke速測では10モデルをカバーし、Grok 4が95.44点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観測に適しているが、Full週間ランキングの結論とは同等ではない。

今回のSmokeテストはコード実行とソース制約の2つのメインランキング次元のみをカバーしており、メインランキングの計算式は0.55 × コード実行 + 0.45 × ソース制約である。一日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価ではなく、モニタリングシグナルとして活用するのが適切である。

当日ランキング

順位モデルメインランキングコード実行ソース制約誠実性
#1Grok 495.4491.7100warn
#2Gemini 3.1 Pro95.1910089.3pass
#3DeepSeek V4 Pro95.0110088.9pass
#4Doubao Pro90.6291.789.3pass
#5Gemini 2.5 Pro85.6391.778.2pass
#6GPT-o381.447589.3pass
#7GPT-5.576.447578.2pass
#8Claude Sonnet 4.672.550100pass
#9Qwen3 Max72.2558.389.3pass
#10Claude Opus 4.770.7755.689.3pass

データ解説

本日のWinzheng YZ Index Smoke速測において、上位モデルはコード実行とソース制約の組み合わせにおいてそれぞれ異なる特徴を示した。Grok 4はメインランキング95.44点、コード実行91.7点、ソース制約100点であり、ソース制約スコアが突出している。Gemini 3.1 Proはメインランキング95.19点、コード実行100点、ソース制約89.3点であり、コード実行次元で満点を獲得した。DeepSeek V4 Proはメインランキング95.01点、コード実行100点、ソース制約88.9点であり、同様にコード実行の高スコアに支えられている。Doubao Proはメインランキング90.62点、コード実行91.7点、ソース制約89.3点であり、両次元でバランスの取れた結果となった。

直前の同条件実行と比較すると、一部のモデルで顕著な変動が見られた。Claude Opus 4.7はメインランキング−26.2点、コード実行−44.4点。Grok 4はメインランキング+20.1点、コード実行+17.4点、ソース制約+23.3点。Gemini 3.1 Proはメインランキング+19.8点、コード実行+25.7点、ソース制約+12.6点。DeepSeek V4 Proはメインランキング+19.2点、コード実行+25点、ソース制約+12.2点。Gemini 2.5 Proはメインランキング+18.4点、コード実行+41.7点、ソース制約−10.1点。

異常シグナルとして、GPT-5.5のメインランキングが−10.1点、Claude Sonnet 4.6が−17点、Qwen3 Maxが−17.3点、Claude Opus 4.7が−26.2点と急落しており、これらの変化は問題のサンプリング変動による可能性もあれば、実際の性能低下の初期シグナルである可能性もあり、後続の実行による確認が必要である。GLM-4.6はデータが不完全であったため自動再実行に入っており、今回のランキングには参加していない。Smokeは小サンプルの単日シグナルであり、上記の観察はあくまで参考情報として扱われたい。

主な変化

  • Claude Opus 4.7:メインランキング−26.2点、コード実行−44.4点
  • Grok 4:メインランキング+20.1点、コード実行+17.4点、ソース制約+23.3点、誠実性 pass→warn
  • Gemini 3.1 Pro:メインランキング+19.8点、コード実行+25.7点、ソース制約+12.6点
  • DeepSeek V4 Pro:メインランキング+19.2点、コード実行+25点、ソース制約+12.2点
  • Gemini 2.5 Pro:メインランキング+18.4点、コード実行+41.7点、ソース制約−10.1点

注目すべきシグナル

  • GPT-5.5:メインランキング急落 −10.1点
  • Claude Sonnet 4.6:メインランキング急落 −17点
  • Qwen3 Max:メインランキング急落 −17.3点
  • Claude Opus 4.7:メインランキング急落 −26.2点
  • GLM-4.6:データ不完全(複数次元でAPIエラー/タイムアウトが発生)のため自動再実行に入っており、今回のランキングには参加しない

このようなSmoke速報を読む際には、2つの点に重点を置くべきである。第1に、あるモデルが複数日にわたって同種の弱点を繰り返し露呈しているかどうか。第2に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行またはソース制約スコアの大幅な変動は、問題のサンプリングによるものである場合も、実際の性能低下の初期シグナルである場合もあり、後続の実行による確認が必要である。


データ出典:YZ Index | Run #332 | 元データを見る