Claude Opus 4.7が100点で首位:2026-07-20 YZ Index Smoke クイックテスト データレポート

Claude Opus 4.7が100点で首位:2026-07-20 YZ Index Smoke クイックテスト データレポート

2026-07-20 YZ Index Smoke クイックテストは11モデルを対象とし、Claude Opus 4.7が100点で当日首位を獲得しました。Smokeは毎日10問のクイックテストであり、短期シグナルの観察に適しており、Fullウィークリーランキングの結論とは同等ではありません。

今回のSmokeテストはコード実行とマテリアル制約の2つのメインランキング次元のみをカバーしており、メインランキングの計算式は 0.55 × コード実行 + 0.45 × マテリアル制約 です。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価ではなく、監視シグナルとして活用するのが適切です。

当日ランキング

順位モデルメインランキングコード実行マテリアル制約誠実性
#1Claude Opus 4.7100100100pass
#2Doubao Pro83.737594.4pass
#3GPT-o382.77592.1pass
#4Gemini 3.1 Pro81.937590.4pass
#5Grok 480.817587.9warn
#6DeepSeek V4 Pro80.277586.7warn
#7GPT-5.579.917585.9pass
#8Gemini 2.5 Pro69.985094.4pass
#9Qwen3 Max67.3165.669.4warn
#10Claude Sonnet 4.664.3971.955.2pass
#11GLM-4.658.7525100warn

データ解説

本日のメインランキング上位4モデルのうち、Claude Opus 4.7はコード実行100・マテリアル制約100によりメインランキング100を獲得し、両次元で均衡した高水準を示しました。Doubao Proのメインランキング83.73はコード実行75とマテリアル制約94.4の組み合わせ、GPT-o3のメインランキング82.7はコード実行75・マテリアル制約92.1、Gemini 3.1 Proのメインランキング81.93はコード実行75・マテリアル制約90.4に対応しており、この構造は現在のサンプルにおいてマテリアル制約が相対的に強い組み合わせが総合スコアに大きく貢献していることを示しています。

Doubao Proのメインランキングは前回同条件のrunと比べて34.5点上昇しており、主にコード実行が50点上昇したことによるものです。GLM-4.6のメインランキングは27.3点上昇し、マテリアル制約が60.7点上昇しています。Gemini 3.1 Proのメインランキングは25.5点上昇し、コード実行+25点・マテリアル制約+26.1点に対応しています。異常シグナルとしては、Gemini 2.5 Proのコード実行が-24.6点と急落し、Qwen3 Maxのメインランキングが-14.9点、Claude Sonnet 4.6のメインランキングが-25.6点急落しており、これらの単日変化は問題のサンプリングによるばらつきが原因である可能性もありますが、モデルの実際のパフォーマンス低下の可能性もあるため、後続の同条件runによる確認が必要です。

Smokeテストは小規模サンプルによる単日シグナルであり、以上の観察は当日のデータ分布のみを反映するものであり、モデルの長期的な安定性についての判断を行うものではありません。

主な変化

  • Doubao Pro:メインランキング+34.5点、コード実行+50点、マテリアル制約+15.6点
  • GLM-4.6:メインランキング+27.3点、マテリアル制約+60.7点
  • Claude Sonnet 4.6:メインランキング-25.6点、コード実行-27.3点、マテリアル制約-23.6点
  • Gemini 3.1 Pro:メインランキング+25.5点、コード実行+25点、マテリアル制約+26.1点
  • DeepSeek V4 Pro:メインランキング+17.3点、コード実行+25点、マテリアル制約+7.9点、誠実性 pass→warn

注目すべきシグナル

  • Gemini 2.5 Pro:コード実行が-24.6点と急落
  • Qwen3 Max:メインランキングが-14.9点と急落
  • Claude Sonnet 4.6:メインランキングが-25.6点と急落

この種のSmokeレポートを読む際には、2つの点に注目すべきです。第一に、特定のモデルが複数日にわたって同種の弱点を示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに変化しているかどうかです。単日のコード実行またはマテリアル制約スコアの大幅な変動は、問題のサンプリングによるものである可能性も、実際のパフォーマンス低下の初期シグナルである可能性もあり、後続のrunによる確認が必要です。


データ出典:YZ Index | Run #238 | 生データを見る