2026年7月31日のYZ Index Smoke速測は10モデルを対象とし、DeepSeek V4 Proが96.94点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適しており、Fullウィークリーランキングの結論とは同一ではない。
今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの計算式は 0.55 × コード実行 + 0.45 × 資料制約 である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な判断としてではなく、モニタリングシグナルとして活用することが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | DeepSeek V4 Pro | 96.94 | 100 | 93.2 | pass |
| #2 | GPT-o3 | 93.16 | 95 | 90.9 | pass |
| #3 | Claude Opus 4.7 | 92.85 | 100 | 84.1 | pass |
| #4 | GPT-5.5 | 86.63 | 95 | 76.4 | pass |
| #5 | Grok 4 | 77.72 | 72.5 | 84.1 | pass |
| #6 | Gemini 3.1 Pro | 76.35 | 70 | 84.1 | pass |
| #7 | Doubao Pro | 75 | 75 | 75 | pass |
| #8 | Claude Sonnet 4.6 | 74.04 | 100 | 42.3 | pass |
| #9 | Qwen3 Max | 72.34 | 92.5 | 47.7 | pass |
| #10 | Gemini 2.5 Pro | 69.26 | 72 | 65.9 | pass |
データ解説
本日のYZ Index Smoke速測において、DeepSeek V4 Proはコード実行100・資料制約93.2の組み合わせでメインランキング96.94を獲得し、GPT-o3はコード実行95・資料制約90.9で93.16のスコアを記録、Claude Opus 4.7も同様にコード実行100ながら資料制約84.1でメインランキング92.85となった。上位モデルの多くはコード実行と資料制約のバランスが取れているか、いずれかが優勢な組み合わせを示している一方、Claude Sonnet 4.6はコード実行100に対して資料制約42.3、Qwen3 Maxはコード実行92.5に対して資料制約47.7と、強弱の組み合わせに顕著な差が見られる。
前回同条件のrunと比較すると、DeepSeek V4 Proはメインランキング+20.1点・コード実行+25点・資料制約+14.1点、GPT-o3はメインランキング+13.3点・コード実行+20点、Qwen3 Maxはメインランキング+11.8点ながら資料制約-20点、Gemini 2.5 Proは資料制約+20.9点となった。これらの変動は問題のサンプリングによる偏りに起因する可能性もあれば、実際の性能低下の兆候である可能性もあり、今後のrunによる確認が必要である。
Grok 4のコード実行が-19.5点急落、Qwen3 Maxの資料制約が-20点急落したことは異常シグナルを構成している。GLM-4.6はAPI障害によりデータが不完全であったため自動再実行が行われており、本期のランキングには参加していない。Smokeは小サンプルの日次シグナルであるため、上記の変化はあくまで参考情報であり、長期的な結論は導かない。
主な変化
- DeepSeek V4 Pro:メインランキング+20.1点、コード実行+25点、資料制約+14.1点
- GPT-o3:メインランキング+13.3点、コード実行+20点、資料制約+5点
- Qwen3 Max:メインランキング+11.8点、コード実行+37.8点、資料制約-20点
- Gemini 2.5 Pro:メインランキング+8.5点、資料制約+20.9点
- Claude Opus 4.7:メインランキング+6.3点、資料制約+14.1点
注目すべきシグナル
- Grok 4:コード実行が-19.5点急落
- Qwen3 Max:資料制約が-20点急落
- GLM-4.6:データ不完全(API障害・タイムアウトにより一部次元が欠落)のため自動再実行に移行しており、本期のランキングには参加しない
このようなSmoke速報を読む際には、二つの点に注目すべきである。第一に、特定のモデルが複数日にわたって同種の弱点を示し続けているかどうか。第二に、誠実性評価がpassからwarnまたはfailに変化しているかどうか。単日のコード実行スコアや資料制約スコアの大幅な変動は、問題サンプリングによるものである可能性もあれば、実際の性能低下の早期シグナルである可能性もあり、今後のrunによる確認が必要である。
データ出典:YZ Index | Run #255 | 原データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接