2026-07-30 YZ Index Smokeテストは11モデルをカバーし、Claude Opus 4.7とGPT-5.5が86.5点で当日の同率首位となった。Smokeは毎日10問の速報テストであり、短期シグナルの観察に適しているが、Full週次ランキングの結論とは同等ではない。
今回のSmoke評価はコード実行と資料制約の2つの主要ランキング次元のみをカバーしており、主要ランキングの算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価よりも、モニタリングシグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | 主要スコア | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 86.5 | 100 | 70 | pass |
| #2 | GPT-5.5 | 86.5 | 100 | 70 | pass |
| #3 | GPT-o3 | 79.91 | 75 | 85.9 | pass |
| #4 | Claude Sonnet 4.6 | 78.86 | 96.9 | 56.8 | pass |
| #5 | Grok 4 | 78.01 | 92 | 60.9 | pass |
| #6 | DeepSeek V4 Pro | 76.85 | 75 | 79.1 | pass |
| #7 | Doubao Pro | 75 | 75 | 75 | pass |
| #8 | Gemini 3.1 Pro | 72.75 | 75 | 70 | pass |
| #9 | Gemini 2.5 Pro | 60.79 | 73.7 | 45 | pass |
| #10 | Qwen3 Max | 60.55 | 54.7 | 67.7 | pass |
| #11 | GLM-4.6 | 39.56 | 50 | 26.8 | pass |
主な変動
- GPT-5.5:主要スコア+19.8点、コード実行+25点、資料制約+13.5点
- Grok 4:主要スコア-11.3点、コード実行-5.8点、資料制約-18点
- Claude Opus 4.7:主要スコア+9.7点、コード実行+25点、資料制約-8.9点
- Claude Sonnet 4.6:主要スコア+8.1点、コード実行+21.9点、資料制約-8.8点
- Qwen3 Max:主要スコア-7.5点、コード実行-17.8点、資料制約+5.1点
注目すべきシグナル
- Grok 4:主要スコアが急落 -11.3点
- DeepSeek V4 Pro:コード実行が急落 -25点
- Doubao Pro:コード実行が急落 -22点
- Gemini 2.5 Pro:資料制約が急落 -24.8点
- Qwen3 Max:コード実行が急落 -17.8点
- GLM-4.6:資料制約が急落 -40.7点
このようなSmoke速報を読む際は、2点に注目すべきである。第一に、あるモデルが複数日連続して同種の弱点を示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailへ移行していないかどうか。単日のコード実行スコアや資料制約スコアの大幅な変動は、問題のサンプリングによるものである可能性もあるが、実際の性能劣化の初期シグナルである可能性もあり、後続の実行での検証が必要である。
データ出典:YZ Index | Run #254 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接