Doubao Proが83.94点で首位:2026-09-12 YZ Index Smoke速報データブリーフィング

2026-09-12 YZ Index Smoke速測は10モデルをカバーし、Doubao Proが83.94点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適しており、Fullウィークリーランキングの結論とは同一視できない。

今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの計算式は 0.55 × コード実行 + 0.45 × 資料制約 である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な結論ではなく、監視シグナルとして活用するのが適切である。

当日ランキング

順位モデルメインランキングコード実行資料制約誠実性
#1Doubao Pro83.9410064.3pass
#2Qwen3 Max83.599.264.3pass
#3Claude Opus 4.782.299764.3pass
#4GPT-5.582.299764.3pass
#5GPT-o381.0894.864.3pass
#6Grok 476.5896.252.6pass
#7Claude Sonnet 4.676.295.552.6pass
#8Gemini 2.5 Pro76.1173.579.3pass
#9DeepSeek V4 Pro63.277252.6pass
#10Gemini 3.1 Pro58.9154.564.3pass

データ解説

本日のSmoke速測では、上位モデルのコード実行と資料制約の組み合わせに集中的な特徴が見られた。Doubao Proはメインランキング83.94、コード実行100、資料制約64.3;Qwen3 Maxはメインランキング83.5、コード実行99.2、資料制約64.3;Claude Opus 4.7とGPT-5.5はともにメインランキング82.29、コード実行97、資料制約64.3;GPT-o3はメインランキング81.08、コード実行94.8、資料制約64.3となった。これらのモデルはコード実行スコアが高く、資料制約は64.3を維持しており、高コード実行と中程度の資料制約を組み合わせた構造を形成している。

Gemini 2.5 Proはメインランキング76.11、コード実行73.5、資料制約79.3であり、資料制約が相対的に強い。主な変化としては、Gemini 3.1 Proがメインランキング-34.6点、コード実行-45.5点、資料制約-21.2点;DeepSeek V4 Proがメインランキング-22.8点、コード実行-11.3点、資料制約-36.9点;Qwen3 Maxがメインランキング+12.6点、コード実行+24.2点;GPT-o3がメインランキング-12.4点、コード実行-5.2点、資料制約-21.2点;Grok 4がメインランキング-12.1点、資料制約-25.2点となった。これらのシグナルは問題のサンプリング変動に起因する可能性もあれば、真の性能劣化である可能性もあり、後続の実行で検証が必要である。Smokeは小サンプルの単日シグナルであるため、解釈は慎重に行うべきである。

主な変化

  • Gemini 3.1 Pro:メインランキング34.6点下降、コード実行-45.5点、資料制約-21.2点
  • DeepSeek V4 Pro:メインランキング22.8点下降、コード実行-11.3点、資料制約-36.9点
  • Qwen3 Max:メインランキング12.6点上昇、コード実行+24.2点
  • GPT-o3:メインランキング12.4点下降、コード実行-5.2点、資料制約-21.2点
  • Grok 4:メインランキング12.1点下降、資料制約-25.2点

注目すべきシグナル

  • 今回は公表すべき異常シグナルは確認されなかった。

このようなSmoke速報を読む際には、2つの点に注目すべきである。第一に、あるモデルが複数日にわたって同種の弱点を継続的に示しているかどうか;第二に、誠実性評価がpassからwarnまたはfailに移行していないかどうかである。単日のコード実行または資料制約スコアの大幅な変化は、問題のサンプリングに起因する場合もあれば、真の性能劣化の早期シグナルである場合もあり、後続の実行による検証が必要である。


データ出典:YZ Index | Run #319 | 元データを見る