Claude Sonnet 4.6が94.74点で首位:2026年10月9日 YZ Index Smoke クイックテスト日次レポート

2026年10月9日のYZ Index Smokeクイックテストは14モデルを対象とし、Claude Sonnet 4.6が94.74点で当日首位を獲得した。Smokeは毎日10問のクイックテストであり、短期シグナルの観察に適しているが、Fullウィークリーランキングの結論とは同一ではない。

今回のSmokeテストはコード実行とマテリアル制約の2つのメインランキング次元のみを対象としており、メインランキングの計算式は0.55 × コード実行 + 0.45 × マテリアル制約である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な結論としてではなく、モニタリングシグナルとして活用することが適切である。

当日ランキング

順位モデルメインランキングコード実行マテリアル制約誠実性
#1Claude Sonnet 4.694.7410088.3pass
#2Claude Opus 4.786.2575100pass
#3Doubao Pro86.2575100pass
#4GPT-6.1 Sol85.3383.387.8pass
#5DeepSeek V4 Pro84.97597pass
#6GPT-6 Astra83.9883.384.8pass
#7Gemini 3.1 Pro757575pass
#8GPT-5.5757575pass
#9GPT-6 Luna74.8258.395pass
#10Qwen3 Max73.6372.575pass
#11GPT-6 Sol72.667569.8pass
#12GPT-o371.858.388.3pass
#13Grok 467.245088.3pass
#14Gemini 2.5 Pro65.8258.375pass

データ解説

スコア構成の観点から見ると、Claude Sonnet 4.6はコード実行100とマテリアル制約88.3の組み合わせによりメインランキング94.74でトップに立ち、コード実行における優位性が顕著である。Claude Opus 4.7とDoubao Proはいずれもコード実行75・マテリアル制約100の組み合わせを示しており、メインランキング同点の86.25となり、マテリアル制約の高得点がランキング押し上げに寄与していることがわかる。GPT-6.1 Solはコード実行83.3・マテリアル制約87.8の組み合わせでメインランキング85.33の第4位となり、DeepSeek V4 Proはコード実行75・マテリアル制約97の構成でメインランキング84.9を支えている。

顕著な変化として、DeepSeek V4 Proのメインランキング+29.2点・コード実行+50点、Doubao Proのメインランキング+25.6点・コード実行+25点・マテリアル制約+26.4点、GPT-6.1 Solのメインランキング+24.1点・コード実行+33.3点といった上昇が見られる。これらの上昇幅は当日の問題サンプリングのばらつきに起因する可能性もあれば、特定次元における一時的なパフォーマンスを反映している可能性もあり、後続の実行による安定性の確認が必要である。異常シグナルとして、GPT-6 Lunaのメインランキングが-8.4点、GPT-o3のコード実行が-16.7点、Grok 4のコード実行が-20.3点と急落しており、これらも追加データによる実質的な性能低下かどうかの判断が求められる。

GLM-4.6はデータ不完全のためランキング対象外となっており、Smoke全体の結果は依然として小サンプルの単日シグナルであるため、解釈は慎重に行うべきである。

主な変化

  • DeepSeek V4 Pro:メインランキング+29.2点、コード実行+50点
  • Doubao Pro:メインランキング+25.6点、コード実行+25点、マテリアル制約+26.4点
  • GPT-6.1 Sol:メインランキング+24.1点、コード実行+33.3点、マテリアル制約+12.8点
  • GPT-6 Astra:メインランキング+22.7点、コード実行+33.3点、マテリアル制約+9.8点
  • Gemini 3.1 Pro:メインランキング+16.2点、コード実行+25点、マテリアル制約+5.4点

注目すべきシグナル

  • GPT-6 Luna:メインランキング急落 -8.4点
  • GLM-4.6:データ不完全(integrity・communicationの次元欠損、API障害/タイムアウト)、自動再実行に移行済みのため本期ランキング対象外
  • GPT-o3:コード実行急落 -16.7点
  • Grok 4:コード実行急落 -20.3点

このようなSmokeレポートを読む際は、二つの点に重点を置くべきである。第一に、あるモデルが複数日連続して同種の弱点を露呈しているか。第二に、誠実性評価がpassからwarnまたはfailに移行していないか。単日のコード実行またはマテリアル制約スコアの大幅な変動は、問題サンプリングに起因する場合もあれば、実質的な性能低下の早期シグナルである場合もあり、後続の実行による確認が必要である。


データ出典:YZ Index | Run #368 | 元データを見る