2026-09-09 YZ Index Smoke速測は10モデルを対象とし、Doubao Proが89.91点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適しているが、Fullの週間ランキングの結論とは同一ではない。
今回のSmokeの評価はコード実行と資料制約の2つのメインランキング次元のみを対象としており、メインランキングの計算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な結論としてではなく、モニタリングシグナルとして活用することが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Doubao Pro | 89.91 | 94.5 | 84.3 | pass |
| #2 | Grok 4 | 88.42 | 93.5 | 82.2 | warn |
| #3 | GPT-o3 | 86.04 | 94.5 | 75.7 | pass |
| #4 | GPT-5.5 | 84.11 | 94.5 | 71.4 | pass |
| #5 | Claude Sonnet 4.6 | 81.86 | 94.5 | 66.4 | pass |
| #6 | Claude Opus 4.7 | 80.98 | 69.5 | 95 | pass |
| #7 | DeepSeek V4 Pro | 76.48 | 69.5 | 85 | pass |
| #8 | Gemini 3.1 Pro | 74.21 | 76.5 | 71.4 | pass |
| #9 | Gemini 2.5 Pro | 73.6 | 69.5 | 78.6 | pass |
| #10 | Qwen3 Max | 72.97 | 69.5 | 77.2 | pass |
主な変動
- GPT-5.5:メインランキング+27.7点、コード実行+44.5点、資料制約+7.1点
- GPT-o3:メインランキング+24.8点、コード実行+44.5点
- Claude Opus 4.7:メインランキング+22.2点、コード実行+44.5点、資料制約-5点
- Qwen3 Max:メインランキング+19.9点、コード実行+25.7点、資料制約+12.9点
- Doubao Pro:メインランキング+15.6点、コード実行+20.7点、資料制約+9.3点
注目すべきシグナル
- Grok 4:資料制約が急落 -17.8点
- Claude Sonnet 4.6:資料制約が急落 -33.6点
- DeepSeek V4 Pro:資料制約が急落 -15点
- GLM-4.6:データ不完全(コード実行・資料制約・判定・誠実性・コミュニケーション次元が欠損、API障害/タイムアウトによる)、自動再実行に移行中のため今回はランキング対象外
この種のSmokeブリーフィングを読む際は、2点に重点を置くべきである。第一に、特定のモデルが同じ種類の弱点を複数日連続して露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに変化しているかどうか。単日のコード実行スコアや資料制約スコアの大幅な変動は、問題のサンプリングによるものである可能性もあれば、真の性能低下の初期シグナルである可能性もあり、後続の実行による検証が必要である。
データ出典:YZ Index | Run #315 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接