2026-09-07 YZ Index Smoke速測は11モデルを対象とし、DeepSeek V4 Pro・Gemini 3.1 Pro・GLM-4.6が83.49点で当日首位に並んだ。Smokeは1日10問の速測であり、短期シグナルの観測に適しており、Full週間ランキングの結論とは同一ではない。
今回のSmokeによる評価はコード実行と資料制約の2つのメインランキング次元のみを対象とし、メインランキングの算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な結論としてではなく、モニタリングシグナルとして参照するのが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | DeepSeek V4 Pro | 83.49 | 100 | 63.3 | pass |
| #2 | Gemini 3.1 Pro | 83.49 | 100 | 63.3 | pass |
| #3 | GLM-4.6 | 83.49 | 100 | 63.3 | warn |
| #4 | Doubao Pro | 80.85 | 99.3 | 58.3 | pass |
| #5 | Grok 4 | 80.13 | 99.3 | 56.7 | pass |
| #6 | GPT-o3 | 77.5 | 100 | 50 | pass |
| #7 | GPT-5.5 | 72.03 | 75 | 68.4 | pass |
| #8 | Gemini 2.5 Pro | 71.16 | 73.5 | 68.3 | pass |
| #9 | Claude Sonnet 4.6 | 65.24 | 75 | 53.3 | pass |
| #10 | Claude Opus 4.7 | 61.25 | 50 | 75 | pass |
| #11 | Qwen3 Max | 55.99 | 50 | 63.3 | pass |
主な変化
- GLM-4.6:メインランキング+19.8点、コード実行+30点、資料制約+7.4点、誠実性pass→warn
- Gemini 2.5 Pro:メインランキング-17.1点、コード実行-16.6点、資料制約-17.6点
- Doubao Pro:メインランキング+14.7点、コード実行+49.3点、資料制約-27.6点
- Grok 4:メインランキング+11.5点、コード実行+24.3点
- DeepSeek V4 Pro:メインランキング+6.1点、コード実行+8.3点
注目すべきシグナル
- Doubao Pro:資料制約が急落 -27.6点
- GPT-o3:資料制約が急落 -20点
- Gemini 2.5 Pro:メインランキングが急落 -17.1点
この種のSmokeブリーフィングを読む際は、2つの点に重点を置くべきである。第1に、あるモデルが複数日連続して同じ種類の弱点を露呈しているかどうか。第2に、誠実性評価がpassからwarnまたはfailへ移行しているかどうか。単日のコード実行スコアや資料制約スコアの大幅な変動は、設問のサンプリングに起因する場合もあれば、実際の性能劣化の初期シグナルである場合もあり、後続のrunによる検証が必要である。
データ出典:YZ Index | Run #312 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接