Claude Opus 4.7が96.99点で首位:2026-07-23 YZ Index Smoke速報データブリーフィング

2026-07-23のYZ Index Smoke速測は11モデルをカバーし、Claude Opus 4.7が96.99点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観察に適しているが、Fullウィークリーランキングの結論とは同等ではない。

今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの計算式は0.55 × コード実行 + 0.45 × 資料制約である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な結論ではなく、監視シグナルとして活用するのが適切である。

当日ランキング

順位モデルメインランキングコード実行資料制約誠実性
#1Claude Opus 4.796.9910093.3pass
#2Doubao Pro88.810075.1pass
#3Qwen3 Max82.0383.680.1pass
#4Grok 480.2884.675pass
#5GPT-o3757575pass
#6GPT-5.572.6271.973.5pass
#7Claude Sonnet 4.672.037568.4pass
#8DeepSeek V4 Pro72.037568.4pass
#9Gemini 2.5 Pro69.495093.3pass
#10Gemini 3.1 Pro69.495093.3pass
#11GLM-4.655.742593.3fail

データ解説

本日のYZ Index Smoke速測において、Claude Opus 4.7はメインランキング96.99で首位を獲得し、コード実行100・資料制約93.3の組み合わせが両次元で高水準を維持していることを示している。Doubao Proはメインランキング88.8で、コード実行は同様に100に達しているが資料制約は75.1であり、コード実行側の突出したパフォーマンスを示している。Qwen3 Maxはメインランキング82.03で、コード実行83.6と資料制約80.1が比較的バランスの取れた構成を形成している。下位のGemini 2.5 ProとGemini 3.1 Proはともにメインランキング69.49で、コード実行50・資料制約93.3と資料制約側に明確な優位性を示している。GLM-4.6はメインランキング55.74で、コード実行25・資料制約93.3、かつ誠実性がfailとなっている。

前回の同条件runと比較すると、Claude Sonnet 4.6はメインランキングが24.7点低下し、コード実行が19点、資料制約が31.6点それぞれ低下した。DeepSeek V4 Proも同様にメインランキングが24.7点低下し、コード実行が19点、資料制約が31.6点低下した。GPT-5.5はメインランキングが24.1点低下し、コード実行が22.1点、資料制約が26.5点低下した。GLM-4.6はメインランキングが18.3点低下し、コード実行が72点低下した一方で資料制約は18.3点上昇した。Grok 4はメインランキングが18.1点低下し、コード実行が12.4点、資料制約が25点低下した。これらのスコア変化は設問サンプリングの変動に起因する可能性もあれば、モデルの実際の性能低下によるものである可能性もあり、後続runによる検証確認が必要である。

Smoke速測は小サンプルの日次シグナルであり、以上の観察は当日のデータ構造上の特徴を反映しているにすぎず、長期的な結論は導かない。

主な変化

  • Claude Sonnet 4.6:メインランキング-24.7点、コード実行-19点、資料制約-31.6点、誠実性 warn→pass
  • DeepSeek V4 Pro:メインランキング-24.7点、コード実行-19点、資料制約-31.6点
  • GPT-5.5:メインランキング-24.1点、コード実行-22.1点、資料制約-26.5点
  • GLM-4.6:メインランキング-18.3点、コード実行-72点、資料制約+18.3点
  • Grok 4:メインランキング-18.1点、コード実行-12.4点、資料制約-25点

注目すべきシグナル

  • GLM-4.6:本日の誠実性評価はfail(当日Smokeデータに基づく)。

この種のSmoke簡報を読む際は、二つの点に注目すべきである。第一に、あるモデルが複数日連続して同種の弱点を露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行または資料制約スコアの大幅な変化は、設問サンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである可能性もあり、後続runによる検証が必要である。


データ出典:YZ Index | Run #243 | 原データを見る