GPT-o3が86.25点で首位:2026-08-25 YZ Index Smoke速報データブリーフィング

2026-08-25のYZ Index Smoke速測は11モデルをカバーし、GPT-o3が86.25点で当日首位となった。Smokeは1日10問の速測であり、短期シグナルの観測に適しているが、Fullの週次ランキングの結論とは同一ではない。

今回のSmokeテストはコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価としてではなく、監視シグナルとして活用するのが適切である。

当日ランキング

順位モデルメインコード実行資料制約誠実性
#1GPT-o386.2575100pass
#2GPT-5.583.377593.6pass
#3Grok 483.377593.6pass
#4Doubao Pro81.6791.769.4pass
#5Claude Sonnet 4.680.817587.9pass
#6Gemini 2.5 Pro757575pass
#7Claude Opus 4.772.550100pass
#8Gemini 3.1 Pro70.4466.775pass
#9Qwen3 Max69.985094.4pass
#10DeepSeek V4 Pro56.6941.775pass
#11GLM-4.644.982569.4pass

データ解説

当日のYZ Index Smoke速測において、上位モデルはコード実行と資料制約の組み合わせで明確な差異化が見られた。GPT-o3はコード実行75・資料制約100でメインスコア86.25を獲得し、Claude Opus 4.7はコード実行50・資料制約100でメインスコア72.5となり、資料制約の満点がランキング全体を支える効果が示された。Doubao Proはコード実行91.7・資料制約69.4でメインスコア81.67となり、0.55の重みのもとでコード実行高得点の牽引効果が示された。Gemini 2.5 Proはコード実行75・資料制約75でメインスコア75となり、最もバランスの取れた構成となった。

顕著な変化を示したモデルとして、GLM-4.6はメインスコアが42.6点低下し、コード実行が61.1点低下、資料制約が19.9点低下した。Gemini 3.1 Proはメインスコアが26.5点低下し、コード実行が27.8点低下、資料制約が25点低下した。DeepSeek V4 Proはメインスコアが23.8点低下し、コード実行が52.8点低下、資料制約が11.7点上昇した。Claude Sonnet 4.6はメインスコアが22.6点上昇し、コード実行が30.5点上昇、資料制約が12.9点上昇した。GPT-5.5はメインスコアが18.7点上昇し、コード実行が30.5点上昇した。これらの単日変動は問題のサンプリングによるばらつきに起因する可能性もあれば、モデルの実際のパフォーマンスの短期的な劣化を示している可能性もあり、後続の同条件でのrun実行による検証が必要である。

Smoke速測は小サンプルの単日シグナルであり、上記のスコア構成および変化は当日データの特徴を反映したものに過ぎず、長期的な推論の根拠とするものではない。

主な変化

  • GLM-4.6:メインスコア-42.6点、コード実行-61.1点、資料制約-19.9点、誠実性 warn→pass
  • Gemini 3.1 Pro:メインスコア-26.5点、コード実行-27.8点、資料制約-25点
  • DeepSeek V4 Pro:メインスコア-23.8点、コード実行-52.8点、資料制約+11.7点
  • Claude Sonnet 4.6:メインスコア+22.6点、コード実行+30.5点、資料制約+12.9点
  • GPT-5.5:メインスコア+18.7点、コード実行+30.5点

注目すべきシグナル

  • 今回は公表可能な異常シグナルは確認されなかった。

このようなSmokeブリーフィングを読む際には、2つの点に重点を置くべきである。第一に、あるモデルが複数日連続して同種の弱点を露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行または資料制約スコアの大幅な変動は、問題のサンプリングによるものである可能性もあれば、実際の性能劣化の初期シグナルである可能性もあり、後続のrunによる検証が必要である。


データ出典:YZ Index | Run #294 | 元データを見る