2026-09-19のYZ Index Smoke速測は10モデルを対象とし、Claude Opus 4.7が92.49点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適しているが、Fullの週間ランキングとは同一視できない。
今回のSmokeテストはコード実行とマテリアル制約の2つのメインランキング次元のみをカバーしており、メインランキングの計算式は0.55 × コード実行 + 0.45 × マテリアル制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な結論としてではなく、モニタリングシグナルとして捉えることが適切である。
当日ランキング
| 順位 | モデル | メイン | コード実行 | マテリアル制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 92.49 | 100 | 83.3 | pass |
| #2 | Grok 4 | 88.33 | 96.7 | 78.1 | warn |
| #3 | Claude Sonnet 4.6 | 78.72 | 96 | 57.6 | pass |
| #4 | GPT-o3 | 77.57 | 75 | 80.7 | pass |
| #5 | GPT-5.5 | 77.23 | 83.3 | 69.8 | pass |
| #6 | Qwen3 Max | 77.01 | 98.7 | 50.5 | warn |
| #7 | Doubao Pro | 76.88 | 96 | 53.5 | pass |
| #8 | Gemini 2.5 Pro | 72.22 | 73.7 | 70.4 | pass |
| #9 | Gemini 3.1 Pro | 58.91 | 50 | 69.8 | pass |
| #10 | DeepSeek V4 Pro | 55.02 | 25 | 91.7 | pass |
主な変化
- GPT-o3:メインスコア21.4点低下、コード実行-25点、マテリアル制約-17.1点
- Gemini 2.5 Pro:メインスコア18.7点低下、コード実行-26.3点、マテリアル制約-9.4点
- Claude Sonnet 4.6:メインスコア15.6点低下、マテリアル制約-30.3点
- GPT-5.5:メインスコア15点低下、コード実行-11.7点、マテリアル制約-19.1点
- DeepSeek V4 Pro:メインスコア12.5点低下、コード実行-25点
注目すべきシグナル
- 今回、公表すべき異常シグナルは検出されなかった。
このようなSmoke速報を読む際には、2点に注目すべきである。第一に、あるモデルが複数日連続して同種の弱点を露呈しているか。第二に、誠実性評価がpassからwarnまたはfailに移行しているか。単日のコード実行またはマテリアル制約スコアの大幅な変動は、問題のサンプリングによるものである可能性もあれば、実際の性能劣化の初期シグナルである可能性もあり、後続の実行による検証が必要である。
データ出典:YZ Index | Run #329 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接