Claude Opus 4.7が72.21点で首位:2026-08-14 YZ Index Smoke速報データブリーフィング

2026-08-14のYZ Index Smokeクイックテストは11モデルを対象とし、Claude Opus 4.7が72.21点で当日首位を獲得した。Smokeは毎日10問のクイックテストであり、短期シグナルの観察に適しているが、Fullウィークリーランキングの結論とは同一視できない。

今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみを対象としており、メインランキングの計算式は 0.55 × コード実行 + 0.45 × 資料制約 である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な判断材料としてではなく、モニタリングシグナルとして活用することが適切である。

当日ランキング

順位モデルメインスコアコード実行資料制約誠実性
#1Claude Opus 4.772.217074.9pass
#2Claude Sonnet 4.668.117065.8pass
#3Grok 457.424572.6pass
#4GPT-5.554.364565.8pass
#5Qwen3 Max53.334563.5pass
#6Doubao Pro52.361.740.8pass
#7DeepSeek V4 Pro49.836.765.8pass
#8GPT-o340.14534.1pass
#9Gemini 3.1 Pro38.5536.740.8pass
#10Gemini 2.5 Pro22.252025pass
#11GLM-4.622.252025pass

データ解説

今日のSmokeクイックテストでは、上位モデルにおいてコード実行と資料制約の組み合わせに差異が見られた。Claude Opus 4.7はメインスコア72.21、コード実行70、資料制約74.9。Claude Sonnet 4.6はメインスコア68.11、コード実行70、資料制約65.8で、両者ともに高いコード実行水準を維持している。Grok 4はメインスコア57.42、コード実行45、資料制約72.6で資料制約が相対的に優れており、GPT-5.5はメインスコア54.36、コード実行45、資料制約65.8で資料制約寄りの構造となっている。

複数のモデルで大幅なスコア低下が見られた。GPT-o3はメインスコア-57.2点・コード実行-50点・資料制約-65.9点、Gemini 2.5 Proはメインスコア-57.2点・コード実行-50点・資料制約-65.9点、GLM-4.6はメインスコア-56.2点・コード実行-50点・資料制約-63.7点、Gemini 3.1 Proはメインスコア-45点・コード実行-33.3点・資料制約-59.2点、GPT-5.5はメインスコア-42.9点・コード実行-50点・資料制約-34.2点となった。これらの変化は問題サンプリングの変動によるものである可能性も、実際の性能低下シグナルである可能性もあり、今後の追加実行による確認が必要である。

Smokeは小サンプルの単日シグナルであり、当日のコード実行と資料制約の即時的な組み合わせ状況を反映するに過ぎない。表現は慎重に保ち、長期的な結論は下さない。

主な変化

  • GPT-o3:メインスコア57.2点低下、コード実行-50点、資料制約-65.9点
  • Gemini 2.5 Pro:メインスコア57.2点低下、コード実行-50点、資料制約-65.9点
  • GLM-4.6:メインスコア56.2点低下、コード実行-50点、資料制約-63.7点
  • Gemini 3.1 Pro:メインスコア45点低下、コード実行-33.3点、資料制約-59.2点
  • GPT-5.5:メインスコア42.9点低下、コード実行-50点、資料制約-34.2点

注目すべきシグナル

  • 今回は公開すべき異常シグナルは確認されなかった。

このようなSmoke簡易レポートを読む際には、2つの問いに注目すべきである。第一に、特定のモデルが同じ種類の弱点を複数日にわたって連続して示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。コード実行・資料制約スコアの単日における大幅な変化は、問題サンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである場合もあり、今後の追加実行による確認が必要である。


データ出典:YZ Index | Run #278 | 元データを見る