Claude Opus 4.7とGPT-o3が同率100点首位:2026-08-27 YZ Index Smoke速報データブリーフィング

2026-08-27 YZ Index Smoke速測は11モデルを対象とし、Claude Opus 4.7とGPT-o3が100点で当日首位に並んだ。Smokeは日次10問の速測であり、短期シグナルの観察に適しているが、Fullの週次ランキングの結論とは同一ではない。

今回のSmokeは主榜のうちコード実行と資料制約の2次元のみを対象としており、主榜の算出式は 0.55 × コード実行 + 0.45 × 資料制約 である。日次のサンプル数が少ないため、単日スコアはモデル能力の長期的な判断よりも、監視シグナルとして活用するのが適切である。

当日ランキング

順位モデル主榜コード実行資料制約誠実性
#1Claude Opus 4.7100100100pass
#2GPT-o3100100100pass
#3GPT-5.595.0110088.9pass
#4Grok 493.4696.789.5pass
#5Claude Sonnet 4.690.7810079.5pass
#6Doubao Pro90.7810079.5pass
#7Gemini 3.1 Pro88.7510075pass
#8Gemini 2.5 Pro87.5999.273.4pass
#9GLM-4.686.2575100pass
#10Qwen3 Max84.7492.775pass
#11DeepSeek V4 Pro49.032578.4pass

主な変動

  • GLM-4.6:主榜+38.6点、コード実行+37.5点、資料制約+40点
  • DeepSeek V4 Pro:主榜−35点、コード実行−50点、資料制約−16.6点
  • Claude Opus 4.7:主榜+20.1点、コード実行+25点、資料制約+14.1点
  • GPT-5.5:主榜+11点、コード実行+25点、資料制約−6.1点
  • Gemini 2.5 Pro:主榜−8.5点、資料制約−21.6点

注目すべきシグナル

  • Claude Sonnet 4.6:資料制約が急落 −20.5点
  • Doubao Pro:資料制約が急落 −20.5点
  • Gemini 3.1 Pro:資料制約が急落 −20点
  • Gemini 2.5 Pro:主榜が急落 −8.5点
  • DeepSeek V4 Pro:主榜が急落 −35点

このようなSmokeブリーフィングを読む際は、二点に注目すべきである。第一に、特定モデルが同一カテゴリの弱点を複数日連続して示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行していないかどうか。単日のコード実行・資料制約スコアの大幅な変動は、問題のサンプリングに起因する場合もあれば、実際の性能劣化の早期シグナルである可能性もあり、後続の実行による検証が必要である。


データ出典:YZ Index | Run #297 | 元データを表示