Grok 4が96.99点で首位:2026年8月29日 YZ Index Smoke速報データブリーフィング

2026年8月29日のYZ Index Smoke速測は11モデルを対象とし、Grok 4が96.99点で当日首位となった。Smokeは日次10問の速測であり、短期シグナルの観察に適しているが、Full週次ランキングの結論とは同等ではない。

今回のSmokeテストはコード実行とマテリアル制約の2つのメインランキング指標のみをカバーしており、メインランキングの計算式は 0.55 × コード実行 + 0.45 × マテリアル制約 である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な結論としてではなく、モニタリングシグナルとして扱うのが適切である。

当日ランキング

順位モデルメインランキングコード実行マテリアル制約誠実性
#1Grok 496.9910093.3pass
#2Gemini 3.1 Pro96.699.393.3pass
#3Gemini 2.5 Pro91.9910082.2pass
#4Qwen3 Max91.8290.693.3pass
#5Doubao Pro91.3899.381.7pass
#6Claude Opus 4.783.247593.3pass
#7Claude Sonnet 4.683.247593.3pass
#8GLM-4.683.247593.3pass
#9GPT-o383.247593.3pass
#10DeepSeek V4 Pro78.247582.2pass
#11GPT-5.561.525075.6pass

データ解説

当日のメインランキング上位3モデルのうち、Grok 4はコード実行100・マテリアル制約93.3の組み合わせでメインランキング96.99を獲得し、Gemini 3.1 Proはコード実行99.3・マテリアル制約93.3でメインランキング96.6を記録した。両モデルはコード実行とマテリアル制約の均衡した高水準の組み合わせを示している。Gemini 2.5 Proはコード実行100を達成したものの、マテリアル制約は82.2にとどまりメインランキング91.99となっており、コード実行が突出する一方でマテリアル制約が相対的に弱い構造的特徴を示している。Qwen3 Maxはコード実行90.6・マテリアル制約93.3でメインランキング91.82となり、マテリアル制約がより強い組み合わせを示している。

顕著な変化として、Gemini 3.1 Proはメインランキング+33.1点・コード実行+44.8点・マテリアル制約+18.7点、GLM-4.6はメインランキング+22.2点・コード実行+25点・マテリアル制約+18.7点、DeepSeek V4 Proはメインランキング+19.8点・コード実行+28点・マテリアル制約+9.8点、Grok 4はメインランキング+11.5点・マテリアル制約+20.9点の上昇が見られた。これらの上昇幅は単日問題のサンプリング変動に起因する可能性があり、後続の実行による再検証が必要である。GPT-5.5はメインランキング-24.4点・コード実行-47点と明らかな下落を示した。

異常シグナルとして、Claude Opus 4.7のメインランキングが-10.3点と急落し、Claude Sonnet 4.6のコード実行が-22点急落、GPT-o3のコード実行が-25点急落、GPT-5.5のメインランキングが-24.4点急落した。Smoke速測は小サンプルの単日シグナルであるため、これらの変化は問題のサンプリング変動によるものである可能性もあれば、実際の性能劣化を反映している可能性もあり、安定性の判断には後続の実行による再検証が必要である。

主な変化

  • Gemini 3.1 Pro:メインランキング+33.1点、コード実行+44.8点、マテリアル制約+18.7点
  • GPT-5.5:メインランキング-24.4点、コード実行-47点
  • GLM-4.6:メインランキング+22.2点、コード実行+25点、マテリアル制約+18.7点
  • DeepSeek V4 Pro:メインランキング+19.8点、コード実行+28点、マテリアル制約+9.8点
  • Grok 4:メインランキング+11.5点、マテリアル制約+20.9点、誠実性 warn→pass

注目すべきシグナル

  • Claude Opus 4.7:メインランキング急落 -10.3点
  • Claude Sonnet 4.6:コード実行急落 -22点
  • GPT-o3:コード実行急落 -25点
  • GPT-5.5:メインランキング急落 -24.4点

このようなSmokeブリーフィングを読む際には、2つの点に重点を置くべきである。第一に、特定のモデルが複数日にわたって同じ種類の弱点を露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行やマテリアル制約スコアの大幅な変化は、問題のサンプリングに起因する可能性もあれば、実際の性能劣化の早期シグナルである可能性もあり、後続の実行による再検証が必要である。


データ出典:YZ Index | Run #299 | 元データを見る