Claude Opus 4.7が81.57点で首位:2026-10-04 YZ Index Smoke簡易テスト日次レポート

2026-10-04のYZ Index Smokeテストは15モデルを対象とし、Claude Opus 4.7が81.57点で当日首位となった。Smokeテストは毎日10問の簡易テストであり、短期シグナルの観察に適しているが、Full週次ランキングの結論とは同一視できない。

今回のSmokeテストはコード実行と資料制約の2つのメイン指標のみを対象としており、メインスコアの算式は0.55 × コード実行 + 0.45 × 資料制約である。日次サンプル数が少ないため、単日スコアはモデル能力に関する長期的な結論としてではなく、モニタリングシグナルとして活用することが適切である。

当日ランキング

順位モデルメインスコアコード実行資料制約誠実性
#1Claude Opus 4.781.579762.7pass
#2GPT-o379.4497.857pass
#3Doubao Pro75.579650.6pass
#4Grok 474.295.348.4pass
#5DeepSeek V4 Pro73.527571.7pass
#6Gemini 3.1 Pro72.537569.5pass
#7Qwen3 Max66.6961.672.9pass
#8GPT-6 Luna64.2769.857.5pass
#9Gemini 2.5 Pro63.6869.856.2pass
#10GPT-6.1 Sol62.5169.853.6pass
#11Claude Sonnet 4.662.3271.950.6pass
#12GPT-6 Sol61.1669.850.6pass
#13GPT-5.560.117541.9pass
#14GPT-6 Astra52.8644.862.7pass
#15GLM-4.633.945014.3warn

データ解説

当日メインスコア上位3モデルのうち、Claude Opus 4.7はコード実行97・資料制約62.7の組み合わせで81.57点を獲得し、GPT-o3はコード実行97.8・資料制約57で79.44点、Doubao Proはコード実行96・資料制約50.6で3位となった。これらのモデルはコード実行において高い水準を維持する一方、資料制約のスコアが相対的に低く、明確な偏重構造を形成している。DeepSeek V4 ProとGemini 3.1 Proはより均衡のとれた構成を示しており、前者はコード実行75・資料制約71.7、後者はコード実行75・資料制約69.5で、メインスコアはそれぞれ73.52と72.53である。

複数のモデルで前回同条件のrunと比較して明確な下落が見られた。GPT-6 Solはメインスコアが24.1点低下し資料制約が47.2点下落、Gemini 2.5 Proはメインスコアが23.7点低下しコード実行が30.2点下落、GPT-6 Astraはメインスコアが21.9点低下し資料制約が32.1点下落した。また、Claude Sonnet 4.6とClaude Opus 4.7の資料制約はそれぞれ36.2点と34.3点下落した。Smokeテストは小サンプルの単日シグナルであるため、こうした変化は問題の抽出サンプリングによるばらつきに起因する可能性もあれば、実際の能力低下を反映している可能性もあり、後続runによる確認が必要である。

全体として、上位モデルの多くはコード実行の優位性によってメインスコアを引き上げており、資料制約が弱い構成が当日データに集中して見られた。Qwen3 Maxのコード実行61.6・資料制約72.9という逆転構造はメインスコア66.69をもたらしており、重み付けの組み合わせがランキングに直接影響することを示している。すべての解説は当日の正確な数値に基づいており、外挿は行っていない。

主な変化

  • GPT-6 Sol:メインスコア-24.1点、コード実行-5.2点、資料制約-47.2点
  • Gemini 2.5 Pro:メインスコア-23.7点、コード実行-30.2点、資料制約-15.8点
  • GPT-6 Astra:メインスコア-21.9点、コード実行-13.5点、資料制約-32.1点
  • Claude Sonnet 4.6:メインスコア-17.3点、資料制約-36.2点
  • Claude Opus 4.7:メインスコア-17.1点、資料制約-34.3点

注目すべきシグナル

  • 今回、公開すべき異常シグナルは確認されなかった。

このようなSmokeレポートを読む際は、2つの問いに焦点を当てるべきである。第一に、あるモデルが複数日にわたって同種の弱点を連続して示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行スコアや資料制約スコアの大幅な変動は、問題のサンプリングによるばらつきに起因する場合もあれば、実際の能力低下の初期シグナルである場合もあり、後続runによる確認が必要である。


データ提供:YZ Index | Run #359 | 元データを見る