Doubao Proが96.7点で首位:2026-08-02 YZ Index Smoke速報データブリーフィング

2026-08-02のYZ Index Smoke速測は10モデルを対象とし、Doubao Proが96.7点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観察に適しているが、Fullウィークリーランキングの結論とは同一ではない。

今回のSmoke評価はコード実行とマテリアル制約の2つのメインランキング次元のみを対象とし、メインランキングの計算式は0.55 × コード実行 + 0.45 × マテリアル制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な結論としてではなく、モニタリングシグナルとして活用することが適切である。

当日ランキング

順位モデルメインランキングコード実行マテリアル制約誠実性
#1Doubao Pro96.794100pass
#2Gemini 2.5 Pro96.19795pass
#3GPT-o396.19795pass
#4Grok 496.19795pass
#5Qwen3 Max96.19795pass
#6Claude Opus 4.794.459495pass
#7Claude Sonnet 4.694.459495pass
#8DeepSeek V4 Pro94.459495warn
#9Gemini 3.1 Pro94.459495pass
#10GPT-5.594.459495pass

データ解説

本日のSmoke速測では、Doubao Proがメインランキング96.7でトップとなり、コード実行94・マテリアル制約100の組み合わせでマテリアル制約満点の優位性が際立った。Gemini 2.5 Pro、GPT-o3、Grok 4、Qwen3 Maxはいずれもメインランキング96.1を獲得し、コード実行97・マテリアル制約95の構成でバランスのとれたスコアを形成した。Claude Opus 4.7からGPT-5.5までの各モデルはメインランキング94.45で、コード実行94・マテリアル制約95という異なる強弱の組み合わせによるスコア分布を示した。

Claude Sonnet 4.6は前回同条件の実行からメインランキングが39.4点上昇し、コード実行が42.4点、マテリアル制約が35.8点それぞれ上昇した。Gemini 2.5 Proはメインランキングが35.3点上昇し、コード実行が40.2点、マテリアル制約が29.3点上昇した。GPT-5.5、Grok 4、GPT-o3においてもメインランキングで28.5点から16.8点不等の上昇が見られた。これらの変化は問題のサンプリング変動に起因する可能性があり、後続の実行による確認が必要である。

GLM-4.6はデータ不完全によりintegrity・communication次元が欠如しているため、今回はランキングに参加せず、自動補完実行に移行している。Smoke速測は小サンプルの単日シグナルであり、上記の異常変動の解釈は慎重に行う必要がある。

主な変化

  • Claude Sonnet 4.6:メインランキング+39.4点、コード実行+42.4点、マテリアル制約+35.8点
  • Gemini 2.5 Pro:メインランキング+35.3点、コード実行+40.2点、マテリアル制約+29.3点
  • GPT-5.5:メインランキング+28.5点、コード実行+35.7点、マテリアル制約+19.6点
  • Grok 4:メインランキング+26.5点、コード実行+22点、マテリアル制約+32.1点
  • GPT-o3:メインランキング+16.8点、コード実行+15.2点、マテリアル制約+18.8点

注目すべきシグナル

  • GLM-4.6:データ不完全(integrity・communication次元が欠如、API障害/タイムアウト)のため自動補完実行に移行、今回はランキングに参加しない

このようなSmoke速報を読む際は、二つの点に注目すべきである。第一に、特定のモデルが同じ種類の弱点を複数日連続で露呈していないか。第二に、誠実性評価がpassからwarnまたはfailに移行していないか。単日のコード実行やマテリアル制約スコアの大幅な変動は、問題のサンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである可能性もあり、後続の実行による検証が必要である。


データ出典:YZ Index | Run #257 | 元データを見る