Doubao Pro が95.91点で首位:2026-09-02 YZ Index Smoke クイックテスト・データ速報

2026-09-02 YZ Index Smoke クイックテストは11モデルをカバーし、Doubao Pro が95.91点で当日首位となった。Smokeは毎日10問のクイックテストであり、短期シグナルの観測に適しているが、フル週次ランキングの結論とは同等ではない。

今回のSmokeテストはコード実行とマテリアル制約の2つのメインランキング次元のみをカバーしており、メインランキングの算式は 0.55 × コード実行 + 0.45 × マテリアル制約となっている。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な判断ではなく、モニタリングシグナルとして活用するのが適切である。

当日ランキング

順位モデルメインランキングコード実行マテリアル制約誠実性
#1Doubao Pro95.9110090.9warn
#2GPT-o392.4910083.3pass
#3Claude Sonnet 4.688.3910074.2pass
#4Gemini 2.5 Pro88.3910074.2pass
#5Grok 488.3910074.2pass
#6Gemini 3.1 Pro87.6710072.6pass
#7Claude Opus 4.772.757570pass
#8GPT-5.572.037568.4pass
#9Qwen3 Max69.837563.5pass
#10GLM-4.668.2262.575.2warn
#11DeepSeek V4 Pro67.497558.3pass

データ解釈

本日のYZ Index Smokeクイックテストでは、上位モデルにおけるコード実行とマテリアル制約の組み合わせに明確な差異が見られた。Doubao Proはメインランキング95.91でトップに立ち、コード実行100・マテリアル制約90.9を記録。GPT-o3はメインランキング92.49で、コード実行も100だがマテリアル制約は83.3。Claude Sonnet 4.6・Gemini 2.5 Pro・Grok 4はいずれもメインランキング88.39、コード実行100・マテリアル制約74.2で並んだ。これらのモデルはコード実行満点により総合スコアを引き上げており、マテリアル制約スコアの差がメインランキングの順位を直接左右している。一方、GLM-4.6はコード実行62.5・マテリアル制約75.2という対照的な構成でメインランキング68.22を記録しており、低コード・高マテリアルという別の組み合わせパターンを示している。

複数のモデルで顕著な変動が見られた。DeepSeek V4 Proはメインランキングが15.7点下落・マテリアル制約が41.7点下落、GPT-5.5はメインランキング11.2点下落・マテリアル制約31.6点下落、Claude Opus 4.7はメインランキング10.5点下落・マテリアル制約30点下落となった。Doubao Proはメインランキング8.2点上昇・コード実行11.5点上昇の一方、誠実性評価がpassからwarnに変化した。これらの変動は小サンプルによる単日サンプリングのばらつきに起因する可能性もあれば、実際の性能劣化を反映している可能性もあり、後続ランによる検証が必要である。Qwen3 Maxもメインランキング7.7点下落・マテリアル制約23.3点下落となっており、同様に追加データによる確認が求められる。

全体として、コード実行100のモデルがメインランキング上位6位を占めているが、マテリアル制約の90.9〜72.6というスコア幅がすでにメインランキングに8点以上の差をもたらしている。Smokeクイックテストは小サンプルのシグナルであるため、現時点の結果は当日の参考に限定されるものであり、長期的な判断の根拠とはならない。

主な変動

  • DeepSeek V4 Pro:メインランキング15.7点下落、コード実行+5.5点、マテリアル制約-41.7点
  • GPT-5.5:メインランキング11.2点下落、コード実行+5.5点、マテリアル制約-31.6点
  • Claude Opus 4.7:メインランキング10.5点下落、コード実行+5.5点、マテリアル制約-30点
  • Doubao Pro:メインランキング8.2点上昇、コード実行+11.5点、誠実性 pass→warn
  • Qwen3 Max:メインランキング7.7点下落、コード実行+5点、マテリアル制約-23.3点

注目すべきシグナル

  • 今回、公表可能な異常シグナルは検出されなかった。

このようなSmokeレポートを読む際は、2つの点に注目すべきである。第一に、あるモデルが複数日連続して同種の弱点を露呈していないか。第二に、誠実性評価がpassからwarnまたはfailに移行していないか。コード実行やマテリアル制約スコアの単日における大幅な変動は、設問サンプリングに起因する場合もあれば、実際の性能劣化の早期シグナルである場合もあり、後続ランによる検証が必要である。


データ出典:YZ Index | Run #305 | 元データを見る