2026年8月4日のYZ Index Smokeクイックテストは9モデルを対象とし、Gemini 2.5 Proが89.56点で当日首位となった。Smokeは毎日10問形式のクイックテストであり、短期シグナルの観察に適しているが、Fullウィークリーランキングの結論とは同等ではない。
今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみを対象としており、メインランキングの計算式は 0.55 × コード実行 + 0.45 × 資料制約 である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価としてではなく、モニタリングシグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Gemini 2.5 Pro | 89.56 | 100 | 76.8 | pass |
| #2 | Claude Opus 4.7 | 89.44 | 97 | 80.2 | pass |
| #3 | DeepSeek V4 Pro | 87.91 | 97 | 76.8 | pass |
| #4 | GPT-5.5 | 87.19 | 97 | 75.2 | pass |
| #5 | Claude Sonnet 4.6 | 84.94 | 97 | 70.2 | pass |
| #6 | Qwen3 Max | 84.83 | 92.7 | 75.2 | pass |
| #7 | Grok 4 | 84.34 | 100 | 65.2 | pass |
| #8 | Gemini 3.1 Pro | 83.1 | 97 | 66.1 | pass |
| #9 | GPT-o3 | 80.07 | 88.3 | 70 | pass |
主な変動
- Qwen3 Max:メインランキング+25.9点、コード実行+17.7点、資料制約+35.9点
- Gemini 3.1 Pro:メインランキング+22.5点、コード実行+39.4点
- Claude Sonnet 4.6:メインランキング+22点、コード実行+47点、資料制約−8.6点
- DeepSeek V4 Pro:メインランキング+17.7点、コード実行+22点、資料制約+12.5点
- GPT-5.5:メインランキング+12.4点、コード実行+13.7点、資料制約+10.9点
注目すべきシグナル
- Doubao Pro:データ不完全(一部次元のAPIエラー/タイムアウトにより欠損)、自動再実行処理に入っており、今回のランキングには参加しない
- GLM-4.6:データ不完全(一部次元のAPIエラー/タイムアウトにより欠損)、自動再実行処理に入っており、今回のランキングには参加しない
このようなSmokeブリーフィングを読む際は、2つの点に焦点を当てるべきである。第一に、あるモデルが複数日連続して同じ種類の弱点を示していないか。第二に、誠実性評価がpassからwarnまたはfailに移行していないか。単日のコード実行スコアや資料制約スコアの大幅な変動は、問題サンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである可能性もあり、後続の実行による検証が必要である。
データ提供:YZ Index | Run #260 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接