2026-08-27 YZ Index Smoke速測は11モデルを対象とし、Claude Opus 4.7とGPT-o3が100点で当日首位に並んだ。Smokeは日次10問の速測であり、短期シグナルの観察に適しているが、Fullの週次ランキングの結論とは同一ではない。
今回のSmokeは主榜のうちコード実行と資料制約の2次元のみを対象としており、主榜の算出式は 0.55 × コード実行 + 0.45 × 資料制約 である。日次のサンプル数が少ないため、単日スコアはモデル能力の長期的な判断よりも、監視シグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | 主榜 | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 100 | 100 | 100 | pass |
| #2 | GPT-o3 | 100 | 100 | 100 | pass |
| #3 | GPT-5.5 | 95.01 | 100 | 88.9 | pass |
| #4 | Grok 4 | 93.46 | 96.7 | 89.5 | pass |
| #5 | Claude Sonnet 4.6 | 90.78 | 100 | 79.5 | pass |
| #6 | Doubao Pro | 90.78 | 100 | 79.5 | pass |
| #7 | Gemini 3.1 Pro | 88.75 | 100 | 75 | pass |
| #8 | Gemini 2.5 Pro | 87.59 | 99.2 | 73.4 | pass |
| #9 | GLM-4.6 | 86.25 | 75 | 100 | pass |
| #10 | Qwen3 Max | 84.74 | 92.7 | 75 | pass |
| #11 | DeepSeek V4 Pro | 49.03 | 25 | 78.4 | pass |
主な変動
- GLM-4.6:主榜+38.6点、コード実行+37.5点、資料制約+40点
- DeepSeek V4 Pro:主榜−35点、コード実行−50点、資料制約−16.6点
- Claude Opus 4.7:主榜+20.1点、コード実行+25点、資料制約+14.1点
- GPT-5.5:主榜+11点、コード実行+25点、資料制約−6.1点
- Gemini 2.5 Pro:主榜−8.5点、資料制約−21.6点
注目すべきシグナル
- Claude Sonnet 4.6:資料制約が急落 −20.5点
- Doubao Pro:資料制約が急落 −20.5点
- Gemini 3.1 Pro:資料制約が急落 −20点
- Gemini 2.5 Pro:主榜が急落 −8.5点
- DeepSeek V4 Pro:主榜が急落 −35点
このようなSmokeブリーフィングを読む際は、二点に注目すべきである。第一に、特定モデルが同一カテゴリの弱点を複数日連続して示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行していないかどうか。単日のコード実行・資料制約スコアの大幅な変動は、問題のサンプリングに起因する場合もあれば、実際の性能劣化の早期シグナルである可能性もあり、後続の実行による検証が必要である。
データ出典:YZ Index | Run #297 | 元データを表示
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接