Grok 4が84.21点で首位:2026年7月24日 YZ Index Smoke速報データブリーフィング

2026年7月24日のYZ Index Smoke速測は10モデルを対象に実施され、Grok 4が84.21点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観測に適しているが、Fullウィークリーランキングの結論とは同一ではない。

今回のSmokeテストはコード実行とマテリアル制約の2つのメインランキング次元のみを対象としており、メインランキングの計算式は0.55 × コード実行 + 0.45 × マテリアル制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価ではなく、モニタリングシグナルとして参照するのが適切である。

当日ランキング

順位モデルメインランキングコード実行マテリアル制約誠実性
#1Grok 484.2196.469.3pass
#2Doubao Pro73.927572.6pass
#3GPT-5.573.927572.6pass
#4Claude Opus 4.773.774.672.6pass
#5Gemini 2.5 Pro72.2274.669.3pass
#6DeepSeek V4 Pro68.667560.9pass
#7GPT-o364.927552.6pass
#8Gemini 3.1 Pro59.4758.360.9pass
#9Claude Sonnet 4.658.695069.3pass
#10Qwen3 Max54.915060.9pass

データ解説

スコア構造から見ると、Grok 4はコード実行96.4・マテリアル制約69.3の組み合わせでメインランキング84.21を獲得しており、リードの主因はコード実行の高得点にある。Doubao ProとGPT-5.5はいずれもメインランキング73.92で、コード実行75・マテリアル制約72.6と比較的バランスの取れた分布を示している。Claude Opus 4.7はメインランキング73.7で、コード実行74.6・マテリアル制約72.6。Gemini 2.5 Proはメインランキング72.22で、コード実行74.6・マテリアル制約69.3。上位モデルの中では、コード実行とマテリアル制約の強弱の組み合わせに明確な差異が見られ、一部のモデルはマテリアル制約でコード実行を補完する形となっている。

前回同条件のrunと比較すると、Qwen3 Maxはメインランキングが27.1点低下し、コード実行が33.6点、マテリアル制約が19.2点それぞれ低下した。Claude Opus 4.7はメインランキングが23.3点低下し、コード実行が25.4点、マテリアル制約が20.7点低下した。Doubao Proはメインランキングが14.9点低下し、コード実行が25点低下した。Claude Sonnet 4.6はメインランキングが13.3点低下し、コード実行が25点低下した。GPT-o3はメインランキングが10.1点低下し、マテリアル制約が22.4点低下した。これらの変化は問題のサンプリング変動によるものである可能性もあれば、単日シグナルの偶発的な表れである可能性もあり、後続runでの確認が必要である。

Smoke速測は小規模サンプルによる単日シグナルであり、以上の解説は本日のデータのみに基づくものである。表現は慎重に保ち、モデルの長期的なパフォーマンスについての結論は下していない。

主な変化

  • Qwen3 Max:メインランキング-27.1点、コード実行-33.6点、マテリアル制約-19.2点
  • Claude Opus 4.7:メインランキング-23.3点、コード実行-25.4点、マテリアル制約-20.7点
  • Doubao Pro:メインランキング-14.9点、コード実行-25点
  • Claude Sonnet 4.6:メインランキング-13.3点、コード実行-25点
  • GPT-o3:メインランキング-10.1点、マテリアル制約-22.4点

注目すべきシグナル

  • 今回、公開可能な異常シグナルは確認されなかった。

このようなSmokeブリーフィングを読む際は、2つの点に着目すべきである。第一に、あるモデルが複数日にわたって同種の弱点を継続的に示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行またはマテリアル制約スコアの大幅な変化は、問題のサンプリングによるものである場合もあれば、実際の性能低下の初期シグナルである場合もあり、後続runでの確認が必要である。


データ出典:YZ Index | Run #244 | 生データを見る