Claude Opus 4.7が95.63点で首位:2026-10-05 YZ Index Smoke速報データブリーフィング

2026-10-05 YZ Index Smoke速測は14モデルを対象とし、Claude Opus 4.7が95.63点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観察に適しており、Full週次ランキングの結論とは同一ではない。

今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみをカバーし、メインランキングの計算式は0.55 × コード実行 + 0.45 × 資料制約である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な判断としてではなく、モニタリングシグナルとして活用することが適切である。

当日ランキング

順位モデルメインコード実行資料制約誠実性
#1Claude Opus 4.795.6394.597pass
#2GPT-o390.3694.585.3pass
#3GPT-6 Sol89.3794.583.1pass
#4Doubao Pro88.691.385.3pass
#5Gemini 2.5 Pro88.691.385.3pass
#6DeepSeek V4 Pro83.1191.373.1pass
#7Qwen3 Max78.4265.594.2pass
#8Gemini 3.1 Pro76.6169.585.3pass
#9GPT-5.575.6269.583.1pass
#10GPT-6 Luna75.6269.583.1pass
#11GPT-6 Astra73.4669.578.3pass
#12Grok 472.66483.1pass
#13GPT-6.1 Sol71.1269.573.1pass
#14Claude Sonnet 4.664.2144.588.3pass

データ解説

本日のYZ Index Smoke速測では、Claude Opus 4.7がメインスコア95.63で首位となり、コード実行94.5と資料制約97の組み合わせが両次元ともに高水準でバランスが取れた構造的特徴を示している。GPT-o3はメインスコア90.36、コード実行94.5・資料制約85.3であり、同様にコード実行の高スコアを背景に上位を維持している。Doubao ProとGemini 2.5 Proはともにメインスコア88.6、コード実行91.3・資料制約85.3であり、コード実行が資料制約をわずかに上回る組み合わせを示している。Qwen3 Maxはメインスコア78.42で、資料制約94.2の高いパフォーマンスに依存しており、コード実行は65.5にとどまり、資料制約主導の構造を形成している。

GPT-6 Solはメインスコアが前回比28.2点上昇し、コード実行+24.7点・資料制約+32.5点、Gemini 2.5 Proはメインスコア+24.9点、コード実行+21.5点・資料制約+29.1点、GPT-6 Astraはメインスコア+20.6点、コード実行+24.7点・資料制約+15.6点となっており、これらの変動モデルのスコア構造は資料制約とコード実行が同期して、または資料制約寄りに上昇していることを示している。GPT-5.5はメインスコア+15.5点で、コード実行は5.5点下降したが資料制約が41.2点上昇し、Claude Opus 4.7はメインスコア+14.1点かつ資料制約+34.3点となっており、資料制約次元の変動が全体的な順位に顕著な影響を与えていることが反映されている。

異常シグナルについては、Grok 4のコード実行が31.3点急落し、Claude Sonnet 4.6のコード実行が27.4点急落しており、問題のサンプリング変動または単日実行中の一時的な状態変化に起因する可能性があり、後続のrunによる再確認が必要である。GLM-4.6は判断次元のデータが不完全なためランキングに参加しておらず、同様にAPI関連の問題が結果に影響を及ぼした可能性を示唆している。Smokeは小サンプルの日次シグナルであり、以上の観察はすべて当日データに基づくものであり、長期的な推断は行わない。

主な変化

  • GPT-6 Sol:メインスコア+28.2点、コード実行+24.7点、資料制約+32.5点
  • Gemini 2.5 Pro:メインスコア+24.9点、コード実行+21.5点、資料制約+29.1点
  • GPT-6 Astra:メインスコア+20.6点、コード実行+24.7点、資料制約+15.6点
  • GPT-5.5:メインスコア+15.5点、コード実行-5.5点、資料制約+41.2点
  • Claude Opus 4.7:メインスコア+14.1点、資料制約+34.3点

注目すべきシグナル

  • Grok 4:コード実行が急落 -31.3点
  • Claude Sonnet 4.6:コード実行が急落 -27.4点
  • GLM-4.6:データ不完全(judgment次元欠如、APIエラー/タイムアウト)、自動再実行に移行済み、今回のランキングには不参加

このようなSmoke速報を読む際は、2つの問いに注目すべきである。第一に、あるモデルが複数日にわたって同じ種類の弱点を露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行または資料制約スコアの大幅な変動は、問題のサンプリングに起因する場合もあれば、実際の性能劣化の早期シグナルである場合もあり、後続のrunによる再確認が必要である。


データソース:YZ Index | Run #361 | 元データを見る