GPT-o3が91.29点で首位:2026-07-27 YZ Index Smoke速報データブリーフィング

2026-07-27 YZ Index Smoke速測は11モデルをカバーし、GPT-o3が91.29点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適しており、Fullウィークリーランキングの結論とは同一ではない。

今回のSmokeテストはコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの計算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価ではなく、モニタリングシグナルとして活用するのが適切である。

当日ランキング

順位モデルメインランキングコード実行資料制約誠実性
#1GPT-o391.299784.3pass
#2Gemini 3.1 Pro89.049779.3pass
#3GPT-5.586.299773.2pass
#4DeepSeek V4 Pro85.6910068.2pass
#5Doubao Pro84.949770.2pass
#6Gemini 2.5 Pro84.2895.870.2pass
#7Claude Sonnet 4.680.449760.2pass
#8GLM-4.675.697280.2warn
#9Grok 475.1579.270.2pass
#10Claude Opus 4.766.044789.3pass
#11Qwen3 Max62.0759.565.2pass

データ解説

本日のYZ Index Smoke速測では、上位モデルがコード実行と資料制約のバランスにおいてそれぞれ異なる特性を示した。GPT-o3はメインランキング91.29、コード実行97・資料制約84.3と両能力が比較的均衡している。Gemini 3.1 Proはメインランキング89.04、コード実行97・資料制約79.3であり、高いコード実行スコアに支えられている。DeepSeek V4 Proはコード実行100・資料制約68.2、メインランキング85.69で、コード実行に強みがある一方、資料制約がやや弱い構造を示している。GPT-5.5とDoubao Proはともにコード実行97で、資料制約はそれぞれ73.2と70.2、全体的にメインランキング上位に位置している。

顕著な変化としては、GPT-5.5のメインランキング+26.5点・コード実行+52.5点、GPT-o3のメインランキング+21.8点・コード実行+52.5点、Qwen3 Maxのメインランキング+18.9点・コード実行+40点、Claude Sonnet 4.6のメインランキング+15.7点・コード実行+52.5点が挙げられ、これらの上昇にはいずれも資料制約のさまざまな程度の下落が伴っている。異常シグナルとしては、GPT-o3の資料制約急落-15.7点、DeepSeek V4 Proの資料制約急落-31.8点、Doubao Proの資料制約急落-17点、Claude Sonnet 4.6の資料制約急落-29.3点、Grok 4の資料制約急落-29.8点、およびGLM-4.6の誠実性評価がwarnに降格したことが確認された。これらは問題サンプリングの変動によるものか、実際の性能低下の可能性があり、今後の追加テストによる確認が必要である。Smokeは小サンプルの単日シグナルであるため、解釈は慎重に行うべきである。

主な変化

  • GPT-5.5:メインランキング+26.5点、コード実行+52.5点、資料制約-5.2点
  • GPT-o3:メインランキング+21.8点、コード実行+52.5点、資料制約-15.7点
  • Qwen3 Max:メインランキング+18.9点、コード実行+40点、資料制約-6.8点
  • GLM-4.6:メインランキング+18.5点、コード実行+27.5点、資料制約+7.4点、誠実性fail→warn
  • Claude Sonnet 4.6:メインランキング+15.7点、コード実行+52.5点、資料制約-29.3点

注目すべきシグナル

  • GPT-o3:資料制約急落 -15.7 点
  • DeepSeek V4 Pro:資料制約急落 -31.8 点
  • Doubao Pro:資料制約急落 -17 点
  • Claude Sonnet 4.6:資料制約急落 -29.3 点
  • GLM-4.6:誠実性評価がFailに降格(fail→warn)
  • Grok 4:資料制約急落 -29.8 点

このようなSmokeブリーフィングを読む際は、2点に注目すべきである。第一に、特定のモデルが複数日にわたって同種の弱点を示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行または資料制約スコアの大幅な変動は、問題サンプリングによるものである可能性もあるが、実際の性能低下の早期シグナルである可能性もあり、今後の追加テストによる確認が必要である。


データ出典:YZ Index | Run #248 | 元データを見る