Claude Sonnet 4.6が94.61点で首位:2026-08-20 YZ Index Smoke速報データ

2026-08-20のYZ Index Smoke速測は11モデルを対象に実施され、Claude Sonnet 4.6が94.61点で当日首位となった。Smokeは毎日10問の速測であり、短期的なシグナルの観察に適しており、Fullの週次ランキングの結論と同等ではない。

今回のSmokeは「コード実行」と「資料制約」の2つのメインランキング次元のみを対象としており、メインランキングの算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価よりも、監視シグナルとして活用することが適している。

当日ランキング

順位モデルメインランキングコード実行資料制約誠実性
#1Claude Sonnet 4.694.619297.8pass
#2Doubao Pro92.269588.9pass
#3Claude Opus 4.790.169287.9pass
#4Grok 489.8883.497.8pass
#5Qwen3 Max89.2290.387.9pass
#6GPT-5.588.279283.7pass
#7GPT-o384.6376.394.8pass
#8Gemini 3.1 Pro79.516794.8pass
#9Gemini 2.5 Pro62.424583.7pass
#10DeepSeek V4 Pro59.514280.9pass
#11GLM-4.656.164569.8warn

データ解説

本日のYZ Index Smoke速測では、Claude Sonnet 4.6がメインランキング94.61点で首位となり、コード実行92点と資料制約97.8点のバランスの取れた構成を示した。Doubao Proはメインランキング92.26点で、コード実行95点・資料制約88.9点とコード実行がより強い構造を示している。Claude Opus 4.7はメインランキング90.16点で、コード実行92点・資料制約87.9点とやはりコード実行寄りの傾向がある。Grok 4はメインランキング89.88点で、コード実行83.4点・資料制約97.8点と資料制約が相対的に突出している。上位モデルの0.55×コード実行+0.45×資料制約の算式によるスコア差は、主にこの2指標の強弱の組み合わせに起因する。

前回同条件のrunと比較すると、Gemini 3.1 Proはメインランキング+31.2点、コード実行+20点・資料制約+44.8点;Doubao Proはメインランキング+14.8点、コード実行-5点・資料制約+38.9点;GLM-4.6はメインランキング+14.9点、コード実行+20点・資料制約+8.7点で、誠実性評価がpassからwarnに変化した。Gemini 2.5 Proはメインランキング-11.8点、コード実行-28.5点・資料制約+8.7点;GPT-5.5はメインランキング-10.1点、コード実行-5点・資料制約-16.3点となった。これらの変動は問題のサンプリングの揺らぎによる可能性もあれば、単日の実際のパフォーマンスを反映している可能性もあり、後続のrunによる再確認が必要である。

異常シグナルとして、Claude Opus 4.7はメインランキングが-8.2点急落、GPT-5.5は-10.1点急落、GPT-o3はコード実行が-22.2点急落、Gemini 2.5 Proはメインランキングが-11.8点急落した。Smokeは小サンプルの単日シグナルであるため、これらの変動が偶発的な揺らぎなのかモデルの性能劣化なのかを判断するには不十分であり、複数回の再テストによる安定トレンドの観察が推奨される。

主な変化

  • Gemini 3.1 Pro:メインランキング+31.2点、コード実行+20点、資料制約+44.8点
  • GLM-4.6:メインランキング+14.9点、コード実行+20点、資料制約+8.7点、誠実性pass→warn
  • Doubao Pro:メインランキング+14.8点、コード実行-5点、資料制約+38.9点
  • Gemini 2.5 Pro:メインランキング-11.8点、コード実行-28.5点、資料制約+8.7点
  • GPT-5.5:メインランキング-10.1点、コード実行-5点、資料制約-16.3点

注目すべきシグナル

  • Claude Opus 4.7:メインランキング急落 -8.2点
  • GPT-5.5:メインランキング急落 -10.1点
  • GPT-o3:コード実行急落 -22.2点
  • Gemini 2.5 Pro:メインランキング急落 -11.8点

このようなSmokeレポートを読む際は、2点に重点を置くべきである。第一に、あるモデルが複数日にわたって同種の弱点を示し続けているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行・資料制約スコアの大幅な変動は、問題のサンプリングによるものである場合も、性能劣化の早期シグナルである場合もあり、後続のrunによる再確認が必要である。


データ出典:YZ Index | Run #286 | 原データを見る