Doubao Pro が95.52点で首位:2026年10月1日 YZ Index Smoke クイックテストデータ速報

2026年10月1日のYZ Index Smokeクイックテストは15モデルを対象とし、Doubao Proが95.52点で当日首位を獲得した。Smokeは毎日10問のクイックテストであり、短期シグナルの観察に適しており、Full週間ランキングの結論とは同一視できない。

今回のSmokeテストは、コード実行と資料制約の2つのメインランキング次元のみを対象としており、メインランキングの計算式は 0.55 × コード実行 + 0.45 × 資料制約 である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価としてではなく、モニタリングシグナルとして捉えることが適切である。

当日ランキング

順位モデルメインランキングコード実行資料制約誠実性
#1Doubao Pro95.5294.397pass
#2GPT-6 Sol89.569582.9pass
#3GPT-6 Astra88.579580.7pass
#4GPT-6.1 Sol88.579580.7pass
#5Grok 488.3910074.2pass
#6Claude Sonnet 4.687.899579.2pass
#7Claude Opus 4.786.2575100pass
#8GLM-4.6847595pass
#9DeepSeek V4 Pro81.257095pass
#10Gemini 3.1 Pro81.257095pass
#11GPT-o377.397580.3pass
#12Gemini 2.5 Pro77.167085.9pass
#13GPT-6 Luna77.167085.9pass
#14Qwen3 Max77.167085.9pass
#15GPT-5.570.255095pass

データ解説

スコア構成の分析では、Doubao Proがメインランキング95.52点でトップに立ち、コード実行94.3点・資料制約97点とバランスの取れた組み合わせを示した。GPT-6 Solはメインランキング89.56点で、コード実行95点に対して資料制約82.9点となった。Grok 4はコード実行100点・資料制約74.2点でメインランキング88.39点、Claude Opus 4.7は資料制約100点・コード実行75点でメインランキング86.25点となった。GLM-4.6はメインランキング84点で、コード実行75点と資料制約95点の組み合わせも際立っている。これらの上位モデルは、コード実行と資料制約の強弱において各々異なる傾向を持つ。

前回同条件の実行と比較すると、GLM-4.6はメインランキング+31.4点、コード実行+53点、資料制約+5点。Doubao Proはメインランキング+25点、コード実行+22.3点、資料制約+28.3点。DeepSeek V4 Proはメインランキング+24.2点、コード実行+48点、資料制約-5点。Grok 4はメインランキング+19.6点、コード実行+37点。Gemini 2.5 Proはメインランキング+13.3点、コード実行+20点、資料制約+5点となった。これらの変化は、単日テストにおける一部モデルの指標の顕著な変動を示している。

異常シグナルとして、Qwen3 Maxのコード実行が-24点、GPT-5.5のコード実行が-22点と急落した。これらは問題のサンプリングによる変動、または実際の性能低下の可能性が考えられるが、後続の実行で要確認である。Smokeは少サンプルの単日シグナルであり、関連分析は慎重に行い、長期的な結論は下さない。

主な変化

  • GLM-4.6:メインランキング+31.4点、コード実行+53点、資料制約+5点
  • Doubao Pro:メインランキング+25点、コード実行+22.3点、資料制約+28.3点
  • DeepSeek V4 Pro:メインランキング+24.2点、コード実行+48点、資料制約-5点
  • Grok 4:メインランキング+19.6点、コード実行+37点
  • Gemini 2.5 Pro:メインランキング+13.3点、コード実行+20点、資料制約+5点

注目すべきシグナル

  • Qwen3 Max:コード実行が-24点の急落
  • GPT-5.5:コード実行が-22点の急落

このようなSmoke速報を読む際には、2点に焦点を当てるべきである。第一に、特定のモデルが複数日にわたって同種の弱点を露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailへ移行していないかどうか。単日のコード実行または資料制約スコアの大幅な変化は、問題のサンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである可能性もあり、後続の実行による確認が必要である。


データ出典:YZ Index | Run #354 | 元データを見る