Claude Sonnet 4.6とGPT-o3が96.27点で同率首位:2026-07-21 Smokeクイックテストデータ速報

2026-07-21 YZ Index Smokeクイックテストは11モデルを対象に実施され、Claude Sonnet 4.6とGPT-o3が96.27点で当日首位に並んだ。Smokeは毎日10問のクイックテストであり、短期シグナルの観察に適しているが、Fullの週間ランキング結論と同等ではない。

今回のSmokeテストはコード実行とマテリアル制約の2つのメインランキング次元のみをカバーしており、メインランキングの計算式は0.55 × コード実行 + 0.45 × マテリアル制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な結論としてではなく、モニタリングシグナルとして活用するのが適切である。

当日ランキング

順位モデルメインランキングコード実行マテリアル制約誠実性
#1Claude Sonnet 4.696.2710091.7pass
#2GPT-o396.2710091.7pass
#3Doubao Pro92.4910083.3pass
#4Grok 488.893.383.3pass
#5DeepSeek V4 Pro87.8786.789.3pass
#6GPT-5.587.6710072.6pass
#7Gemini 2.5 Pro80.2170.891.7pass
#8Qwen3 Max79.428572.6pass
#9Gemini 3.1 Pro75.978.672.6pass
#10Claude Opus 4.773.927572.6pass
#11GLM-4.662.835078.5pass

データ解説

本日のメインランキング上位2位のClaude Sonnet 4.6とGPT-o3はいずれも96.27点を獲得し、コード実行はともに100、マテリアル制約はともに91.7で、コード実行とマテリアル制約のバランスが均整の取れた構造を示した。Doubao Proのコード実行も100、マテリアル制約83.3、メインランキング92.49;Grok 4のコード実行93.3、マテリアル制約83.3、メインランキング88.8;DeepSeek V4 Proのコード実行86.7、マテリアル制約89.3、メインランキング87.87となっており、各モデルの2指標における組み合わせの差異が浮き彫りになった。

Claude Sonnet 4.6は前回同条件runと比較してメインランキングが31.9点上昇、コード実行が28.1点上昇、マテリアル制約が36.5点上昇した;GPT-o3はメインランキングが13.6点上昇、コード実行が25点上昇;Qwen3 Maxはメインランキングが12.1点上昇、コード実行が19.4点上昇;Gemini 2.5 Proはメインランキングが10.2点上昇、コード実行が20.8点上昇した。一方、Claude Opus 4.7はメインランキングが26.1点急落、コード実行が25点下降、マテリアル制約が27.4点下降した。

Gemini 3.1 Proのマテリアル制約が17.8点急落、Claude Opus 4.7のメインランキングが26.1点急落、GLM-4.6のマテリアル制約が21.5点急落しており、これらの異常シグナルは問題のサンプリング変動によるものか、あるいは実際の性能劣化によるものかの可能性があり、後続のrunによる検証が必要である。Smokeクイックテストは小サンプルの単日シグナルであるため、関連する解釈は慎重に行うべきである。

主な変化

  • Claude Sonnet 4.6:メインランキング+31.9点、コード実行+28.1点、マテリアル制約+36.5点
  • Claude Opus 4.7:メインランキング-26.1点、コード実行-25点、マテリアル制約-27.4点
  • GPT-o3:メインランキング+13.6点、コード実行+25点
  • Qwen3 Max:メインランキング+12.1点、コード実行+19.4点、誠実性 warn→pass
  • Gemini 2.5 Pro:メインランキング+10.2点、コード実行+20.8点

注目すべきシグナル

  • Gemini 3.1 Pro:マテリアル制約が急落 -17.8点
  • Claude Opus 4.7:メインランキングが急落 -26.1点
  • GLM-4.6:マテリアル制約が急落 -21.5点

この種のSmoke速報を読む際は、2つの問いに焦点を当てるべきである:第一に、あるモデルが複数日連続して同種の弱点を露呈しているかどうか;第二に、誠実性評価がpassからwarnまたはfailに変化しているかどうか。単日のコード実行または制約スコアの大幅な変動は、問題のサンプリングによるものかもしれないが、実際の性能劣化の初期シグナルである可能性もあり、後続のrunによる検証が必要である。


データ出典:YZ Index | Run #240 | 生データを見る