DeepSeek V4 Proが96.94点で首位:2026-10-10 YZ Index Smoke速報データブリーフィング

2026-10-10 YZ Index Smoke速測は15モデルを対象とし、DeepSeek V4 Proが96.94点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期的なシグナルの観察に適しているが、Full週次ランキングの結論と同等ではない。

今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの計算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価よりも、モニタリングシグナルとしての活用に適している。

当日ランキング

順位モデルメインコード実行資料制約誠実性
#1DeepSeek V4 Pro96.9410093.2pass
#2GPT-6.1 Sol92.8510084.1pass
#3Claude Opus 4.792.0298.584.1pass
#4Gemini 3.1 Pro91.8110081.8pass
#5GPT-o389.7798.579.1pass
#6GPT-6 Astra88.7510075pass
#7GPT-6 Luna88.7510075pass
#8Doubao Pro86.9110070.9pass
#9GPT-5.586.9110070.9pass
#10Claude Sonnet 4.682.4110060.9pass
#11GPT-6 Sol77.5910050.2pass
#12Qwen3 Max76.7587.563.6pass
#13Grok 4757575warn
#14Gemini 2.5 Pro74.1873.575pass
#15GLM-4.645.662570.9pass

データ解説

本日のYZ Index Smoke速測において、DeepSeek V4 Proはメインスコア96.94で首位を獲得し、コード実行100・資料制約93.2という構成で際立ったバランスを示した。GPT-6.1 Solはコード実行100・資料制約84.1でメイン92.85、Gemini 3.1 Proはコード実行100・資料制約81.8でメイン91.81、Claude Opus 4.7はコード実行98.5・資料制約84.1でメイン92.02を記録した。上位モデルのコード実行スコアは全般的に高水準を維持しており、資料制約のスコア差がメインランキングの順位に直接影響している。

GLM-4.6はメイン45.66、コード実行25・資料制約70.9を記録し、前回実行比でメイン-31.4点・コード実行-33.3点・資料制約-29.1点の大幅下落となった。GPT-o3はメイン89.77、コード実行98.5・資料制約79.1で、前回比メイン+18点・コード実行+40.2点の上昇を記録した。Gemini 3.1 Proはメイン+16.8点・コード実行+25点上昇した。一方、Claude Opus 4.7の資料制約が-15.9点、GPT-6 Lunaの資料制約が-20点、Doubao Proの資料制約が-29.1点、Claude Sonnet 4.6のメインが-12.3点、GPT-6 Solの資料制約が-19.6点と急落しており、これらの異常シグナルは問題のサンプリング変動によるものか、あるいは実際の性能低下の初期シグナルである可能性があり、後続の実行による確認が必要である。Smoke速測は小サンプルの単日シグナルであるため、表現は慎重に保つ。

主な変動

  • GLM-4.6:メイン-31.4点、コード実行-33.3点、資料制約-29.1点、誠実性 warn→pass
  • GPT-o3:メイン+18点、コード実行+40.2点、資料制約-9.2点
  • Gemini 3.1 Pro:メイン+16.8点、コード実行+25点、資料制約+6.8点
  • GPT-6 Luna:メイン+13.9点、コード実行+41.7点、資料制約-20点
  • Claude Sonnet 4.6:メイン-12.3点、資料制約-27.4点

注目すべきシグナル

  • Claude Opus 4.7:資料制約が急落 -15.9点
  • GPT-6 Luna:資料制約が急落 -20点
  • Doubao Pro:資料制約が急落 -29.1点
  • Claude Sonnet 4.6:メインが急落 -12.3点
  • GPT-6 Sol:資料制約が急落 -19.6点
  • GLM-4.6:メインが急落 -31.4点

このようなSmoke速報を読む際は、2つの問いに着目することが重要だ。第一に、あるモデルが複数日連続して同種の弱点を露呈しているかどうか、第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうかである。単日のコード実行または資料制約スコアの大幅な変動は、問題のサンプリングによるものである可能性もあれば、実際の性能低下の初期シグナルである可能性もあり、後続の実行による確認が必要だ。


データ出典:YZ Index | Run #370 | 生データを見る