Claude Sonnet 4.6が96.98点で首位:2026-09-23 YZ Index Smoke速報データブリーフィング

2026-09-23 YZ Index Smoke クイックテストは10モデルを対象とし、Claude Sonnet 4.6が96.98点で当日首位を獲得した。Smokeは毎日10問のクイックテストであり、短期シグナルの観察に適しているが、Full週次ランキングの結論と同等ではない。

今回のSmokeテストはコード実行と資料制約の2つのメインランキング指標のみを対象としており、メインランキングの計算式は 0.55 × コード実行 + 0.45 × 資料制約 である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価ではなく、モニタリングシグナルとして参照するのが適切である。

当日ランキング

順位モデルメインランキングコード実行資料制約誠実性
#1Claude Sonnet 4.696.9894.5100pass
#2Claude Opus 4.796.7694.1100pass
#3Gemini 2.5 Pro95.1993.797pass
#4GPT-5.591.8989.594.8pass
#5Qwen3 Max91.2685.997.8pass
#6Grok 480.8969.594.8pass
#7GPT-o380.4864.5100pass
#8Gemini 3.1 Pro79.1364.597pass
#9DeepSeek V4 Pro78.1464.594.8pass
#10Doubao Pro73.564.584.5pass

データの解説

本日のYZ Index Smokeクイックテストでは、上位モデルがコード実行と資料制約の両指標において均衡した高水準を示した。Claude Sonnet 4.6はメインランキング96.98点で首位となり、コード実行94.5・資料制約100を記録。Claude Opus 4.7はメインランキング96.76点、コード実行94.1・資料制約100。Gemini 2.5 Proはメインランキング95.19点、コード実行93.7・資料制約97。この3モデルはいずれも誠実性がpassを維持し、資料制約は軒並み100に近いか100に達しており、コード実行は93.7から94.5の範囲にあり、強弱が補完し合う構造的優位性を形成している。

複数のモデルで顕著な変動が見られた。Gemini 2.5 Proはメインランキング+22.7点、コード実行+21.7点・資料制約+23.9点。Qwen3 Maxはメインランキング+12.8点、コード実行+13.9点・資料制約+11.5点。DeepSeek V4 Proはメインランキング+12.1点、コード実行-7.5点・資料制約+36.1点。Doubao Proはメインランキング-17.3点、コード実行-31.8点。GPT-o3はメインランキング-15.5点、コード実行-32.5点・資料制約+5.2点。これらの変動は単日10問という少サンプルの抽様に起因しており、スコアの変動が真の性能低下であるかを区別するには、追加の検証が必要である。

異常シグナルは複数のモデルに集中している。Grok 4はメインランキングが-10点と急落し、GPT-o3は-15.5点の急落、Gemini 3.1 Proはコード実行が-31.8点の急落、Doubao Proはメインランキングが-17.3点の急落を記録した。GLM-4.6はAPIの障害によりデータが不完全で、今回のランキングには参加していない。以上はいずれもSmoke単日のシグナルであり、変動幅は問題の抽様による影響を受けている可能性があるため、複数回のテストで安定性を確認する必要がある。

主な変動

  • Gemini 2.5 Pro:メインランキング+22.7点、コード実行+21.7点、資料制約+23.9点
  • Doubao Pro:メインランキング-17.3点、コード実行-31.8点
  • GPT-o3:メインランキング-15.5点、コード実行-32.5点、資料制約+5.2点
  • Qwen3 Max:メインランキング+12.8点、コード実行+13.9点、資料制約+11.5点
  • DeepSeek V4 Pro:メインランキング+12.1点、コード実行-7.5点、資料制約+36.1点

注目すべきシグナル

  • Grok 4:メインランキング急落 -10点
  • GPT-o3:メインランキング急落 -15.5点
  • Gemini 3.1 Pro:コード実行急落 -31.8点
  • Doubao Pro:メインランキング急落 -17.3点
  • GLM-4.6:データ不完全(API障害・タイムアウトにより複数指標が欠損)のため自動再実行中、今回はランキングに参加せず

このようなSmokeブリーフィングを読む際は、2つの点に着目することが重要である。第1に、あるモデルが複数日にわたって同種の弱点を示していないか。第2に、誠実性評価がpassからwarnまたはfailに変化していないか。単日のコード実行や資料制約スコアの大幅な変動は、問題の抽様によるものである場合もあれば、真の性能低下の初期シグナルである可能性もあり、追加の検証が必要である。


データ出典:YZ Index | Run #335 | 元データを見る