DeepSeek V4 Pro が83.23点で首位:2026年7月26日 YZ Index Smoke クイックテスト速報

2026年7月26日のYZ Index Smokeクイックテストは10モデルを対象とし、DeepSeek V4 Proが83.23点で当日首位を獲得した。Smokeは毎日10問のクイックテストであり、短期シグナルの観測には適しているが、Full週間ランキングの結論とは同等ではない。

今回のSmokeテストはコード実行とマテリアル制約の2つのメイン指標のみを対象とし、メインスコアの算出式は 0.55 × コード実行 + 0.45 × マテリアル制約 である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な判断ではなく、モニタリングシグナルとして参照するのが適切である。

当日ランキング

順位モデルメインコード実行マテリアル制約誠実性
#1DeepSeek V4 Pro83.2369.5100pass
#2Gemini 3.1 Pro81.1186.175pass
#3Doubao Pro77.4769.587.2pass
#4Gemini 2.5 Pro73.5169.578.4pass
#5GPT-o369.4844.5100pass
#6Grok 469.4844.5100pass
#7Claude Sonnet 4.664.7544.589.5pass
#8GPT-5.559.7644.578.4pass
#9Claude Opus 4.755.7319.5100pass
#10Qwen3 Max43.1319.572pass

データ解説

当日のYZ Index Smokeクイックテストでは、DeepSeek V4 Proがメインスコア83.23で首位を獲得した。コード実行69.5・マテリアル制約100という構成は、マテリアル制約面での際立った強さを示している。Gemini 3.1 Proはメインスコア81.11で続き、コード実行86.1・マテリアル制約75と、コード実行面での相対的な優位性を示した。Doubao Proはメインスコア77.47で、コード実行69.5・マテリアル制約87.2と、両指標がバランスよく組み合わさっている。上位モデルはコード実行とマテリアル制約の強弱の組み合わせがそれぞれ異なり、現在のメインランキングの構図を形成している。

前回同条件のrunと比較すると、Claude Sonnet 4.6はメインスコアが32.2点低下し、コード実行が50点低下・マテリアル制約が10.5点低下した。Grok 4はメインスコアが27.5点低下し、コード実行が50点低下した。GPT-5.5はメインスコアが27.4点低下し、コード実行が50点低下した。Claude Opus 4.7はメインスコアが22.7点低下し、コード実行が50点低下した一方でマテリアル制約は10.7点上昇した。GPT-o3はメインスコアが11.4点低下し、コード実行が50点低下した一方でマテリアル制約は35.7点上昇した。これらの変化はコード実行指標に集中しており、問題のサンプリングによるばらつきである可能性も、特定の制約下でのモデルの実際のパフォーマンス差である可能性もあり、シグナルの安定性を確認するために後続のrunによる検証が必要である。

Smokeは小サンプルの単日シグナルであり、上記のスコア構造の分析は当日データの特徴を反映するにすぎず、モデルの総合的な能力についての長期的な判断を示すものではない。

主な変動

  • Claude Sonnet 4.6:メインスコア-32.2点、コード実行-50点、マテリアル制約-10.5点
  • Grok 4:メインスコア-27.5点、コード実行-50点
  • GPT-5.5:メインスコア-27.4点、コード実行-50点
  • Claude Opus 4.7:メインスコア-22.7点、コード実行-50点、マテリアル制約+10.7点
  • GPT-o3:メインスコア-11.4点、コード実行-50点、マテリアル制約+35.7点

注目すべきシグナル

  • 今回、公表可能な異常シグナルは確認されなかった。

このようなSmoke速報を読む際は、2点に注目すべきである。第一に、特定のモデルが複数日連続して同種の弱点を露呈していないか。第二に、誠実性評価がpassからwarnまたはfailに移行していないか。単日のコード実行またはマテリアル制約スコアの大幅な変動は、問題のサンプリングに起因する場合もあれば、実際の性能劣化の初期シグナルである場合もあり、後続のrunによる検証が必要である。


データ出典:YZ Index | Run #246 | 元データを見る