Grok 4が98.41点で首位:2026年8月12日 YZ Index Smoke速報データブリーフィング

2026年8月12日のYZ Index Smoke速測は11モデルをカバーし、Grok 4が98.41点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適しており、Fullの週次ランキングの結論とは同一ではない。

今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力に関する長期的な結論としてではなく、モニタリングシグナルとして活用することが適している。

当日ランキング

順位モデルメインランキングコード実行資料制約誠実性
#1Grok 498.4197.1100pass
#2Gemini 2.5 Pro88.5399.675pass
#3Claude Opus 4.786.0374.6100pass
#4GLM-4.679.3862.5100pass
#5Claude Sonnet 4.6757575pass
#6Gemini 3.1 Pro757575pass
#7GPT-o3757575pass
#8Doubao Pro74.6274.375pass
#9DeepSeek V4 Pro70.1274.365pass
#10Qwen3 Max62.7173.150pass
#11GPT-5.561.255075pass

データ解説

本日のYZ Index Smoke速測において、上位モデルはコード実行と資料制約の組み合わせで明確な差異化が見られた。Grok 4はメインランキング98.41で首位となり、コード実行97.1・資料制約100と両次元ともに高水準を維持した。Gemini 2.5 Proはメインランキング88.53で、コード実行99.6に対し資料制約は75にとどまり、コード実行次元での突出が示された。Claude Opus 4.7はメインランキング86.03で、資料制約100・コード実行74.6と、資料制約における相対的な優位性を示した。GLM-4.6はメインランキング79.38で、コード実行62.5・資料制約100と、同様に資料制約のスコアが全体的なパフォーマンスを支えている。

複数のモデルで顕著なスコア変動が見られた。GPT-5.5はメインランキングが21.9点低下し、コード実行が50点低下・資料制約が12.4点上昇した。Gemini 3.1 Proはメインランキングが19.7点低下し、コード実行が25点・資料制約が13.3点それぞれ低下した。Qwen3 Maxはメインランキングが18.9点低下し、コード実行が14.4点・資料制約が24.3点それぞれ低下した。DeepSeek V4 Proはメインランキングが17.9点低下し、コード実行が25.7点・資料制約が8.3点それぞれ低下した。Claude Sonnet 4.6はメインランキングが10.7点低下し、コード実行が25点低下・資料制約が6.7点上昇した。これらの単日変動は問題のサンプリング差異に起因する可能性もあれば、特定の能力における不安定性を反映している可能性もあり、同一条件での追加実行による検証が必要である。

異常シグナルとして、GLM-4.6の誠実性評価がFailに低下し、以前の記録はfail→passであった。この変化は少サンプルの単日テストで生じており、偶発的な変動と真の劣化を区別するためには、より多くの実行データによる検証が必要である。全体的な解釈は当日のスコア構造のみに基づいており、モデルの長期的なパフォーマンスに関する結論は避けるべきである。

主な変化

  • GPT-5.5:メインランキング21.9点低下、コード実行-50点、資料制約+12.4点
  • Gemini 3.1 Pro:メインランキング19.7点低下、コード実行-25点、資料制約-13.3点
  • Qwen3 Max:メインランキング18.9点低下、コード実行-14.4点、資料制約-24.3点
  • DeepSeek V4 Pro:メインランキング17.9点低下、コード実行-25.7点、資料制約-8.3点
  • Claude Sonnet 4.6:メインランキング10.7点低下、コード実行-25点、資料制約+6.7点

注目すべきシグナル

  • GLM-4.6:誠実性評価がFailに低下(fail→pass)

このようなSmokeブリーフィングを読む際は、2つの問題に焦点を当てるべきである。第一に、あるモデルが複数日にわたって同一種類の弱点を露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行または資料制約スコアの大幅な変動は、問題のサンプリングに起因する場合もあれば、真の劣化の初期シグナルである可能性もあり、後続の実行による検証が必要である。


データ出典:YZ Index | Run #275 | 元データを見る