2026-08-11のYZ Index Smokeクイックテストは10モデルを対象に実施され、Gemini 3.1 Proが94.74点で当日首位となった。Smokeは毎日10問のクイックテストであり、短期的なシグナルの観察に適しているが、Fullウィークリーランキングの結論とは同等ではない。
今回のSmokeテストはコード実行と資料制約の2つのメイン指標のみをカバーしており、メインスコアの計算式は 0.55 × コード実行 + 0.45 × 資料制約 となっている。1日あたりのサンプル数が少ないため、単日のスコアはモデル能力の長期的な評価ではなく、モニタリングシグナルとして捉えるのが適切である。
当日ランキング
| 順位 | モデル | メインスコア | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Gemini 3.1 Pro | 94.74 | 100 | 88.3 | pass |
| #2 | Claude Opus 4.7 | 92.94 | 100 | 84.3 | pass |
| #3 | DeepSeek V4 Pro | 87.99 | 100 | 73.3 | pass |
| #4 | Grok 4 | 87.93 | 95.8 | 78.3 | pass |
| #5 | Gemini 2.5 Pro | 86.28 | 92.8 | 78.3 | pass |
| #6 | Claude Sonnet 4.6 | 85.74 | 100 | 68.3 | pass |
| #7 | GPT-o3 | 84.41 | 94.8 | 71.7 | pass |
| #8 | GPT-5.5 | 83.17 | 100 | 62.6 | pass |
| #9 | Qwen3 Max | 81.56 | 87.5 | 74.3 | pass |
| #10 | GLM-4.6 | 74 | 75 | 78.3 | fail |
主な変動
- Claude Sonnet 4.6:メインスコア+30.5点、コード実行+50点、資料制約+6.6点
- Gemini 3.1 Pro:メインスコア+28点、コード実行+33.3点、資料制約+21.6点
- GPT-5.5:メインスコア+24.9点、コード実行+25点、資料制約+24.7点
- Claude Opus 4.7:メインスコア+20.6点、コード実行+25点、資料制約+15.3点
- Qwen3 Max:メインスコア+16.6点、コード実行+12.5点、資料制約+21.5点
注目すべきシグナル
- GLM-4.6:誠実性評価がFailに低下(pass→fail)
- Doubao Pro:データ不完全(複数の評価次元でAPI障害・タイムアウトが発生し、データが欠損)、自動再実行処理中のため今回はランキング対象外
このようなSmokeレポートを読む際は、2つの点に注目すべきである。第一に、特定のモデルが同種の弱点を複数日にわたって連続して示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行スコアや資料制約スコアの大幅な変動は、問題サンプリングのばらつきによる場合もあれば、実際の性能低下の初期シグナルである可能性もあるため、後続の実行による検証が必要である。
データ出典:YZ Index | Run #274 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接