2026-08-24のYZ Index Smoke速測は11モデルを対象とし、Gemini 3.1 Proが96.98点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観測に適しているが、Fullウィークリーランキングの結論とは同一ではない。
今回のSmokeベンチマークはコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの算式は0.55 × コード実行 + 0.45 × 資料制約である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な結論としてではなく、モニタリングシグナルとして活用することが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Gemini 3.1 Pro | 96.98 | 94.5 | 100 | pass |
| #2 | Gemini 2.5 Pro | 92.16 | 94.5 | 89.3 | pass |
| #3 | GLM-4.6 | 87.54 | 86.1 | 89.3 | warn |
| #4 | Grok 4 | 87.09 | 86.1 | 88.3 | pass |
| #5 | Doubao Pro | 86.54 | 94.5 | 76.8 | warn |
| #6 | GPT-o3 | 83.23 | 69.5 | 100 | pass |
| #7 | Claude Opus 4.7 | 82.98 | 77.8 | 89.3 | pass |
| #8 | DeepSeek V4 Pro | 80.46 | 94.5 | 63.3 | pass |
| #9 | Qwen3 Max | 71.73 | 77.8 | 64.3 | pass |
| #10 | GPT-5.5 | 64.66 | 44.5 | 89.3 | pass |
| #11 | Claude Sonnet 4.6 | 58.23 | 44.5 | 75 | pass |
データの解説
本日のYZ Index Smoke速測において、Gemini 3.1 Proはコード実行94.5・資料制約100の組み合わせでメインランキング96.98を獲得し、Gemini 2.5 Proはコード実行94.5・資料制約89.3でメインランキング92.16、GLM-4.6はコード実行86.1・資料制約89.3でメインランキング87.54を記録した。これは上位モデルのコード実行と資料制約における強弱の組み合わせの差異が明確であることを示している。Doubao Proはコード実行94.5ながら資料制約76.8でメインランキング86.54、GPT-o3はコード実行69.5・資料制約100でメインランキング83.23となり、一方が突出しもう一方が制限されるという構造的な特徴が見られる。
前回同条件のrunと比較すると、GLM-4.6はメインランキング+64.1点・コード実行+69.4点・資料制約+57.6点、Gemini 2.5 Proはメインランキング+28.9点・コード実行+25点・資料制約+33.6点、GPT-o3はメインランキング+27.7点・コード実行+19.5点・資料制約+37.6点、Grok 4はメインランキング+22.8点・コード実行+19.4点・資料制約+26.9点、Gemini 3.1 Proはメインランキング+18.5点・資料制約+37.6点の上昇を示しており、これらの上昇幅は単日スコア構造の変化を反映している。
DeepSeek V4 Proの資料制約は-18.4点と急落しており、これは異常シグナルである。問題サンプリングの変動または実際の性能低下が原因である可能性があり、後続のrunによる検証が必要である。Smoke速測は小サンプルの日次シグナルであり、以上の解説は本日のデータのみに基づくものであり、長期的な判断は行っていない。
主な変化
- GLM-4.6:メインランキング+64.1点、コード実行+69.4点、資料制約+57.6点
- Gemini 2.5 Pro:メインランキング+28.9点、コード実行+25点、資料制約+33.6点
- GPT-o3:メインランキング+27.7点、コード実行+19.5点、資料制約+37.6点
- Grok 4:メインランキング+22.8点、コード実行+19.4点、資料制約+26.9点
- Gemini 3.1 Pro:メインランキング+18.5点、資料制約+37.6点
注目すべきシグナル
- DeepSeek V4 Pro:資料制約が急落 -18.4点
このようなSmokeブリーフィングを読む際は、2つの問題に焦点を当てるべきである。第一に、あるモデルが複数日連続して同種の弱点を露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに変化しているかどうか。単日のコード実行または資料制約スコアの大幅な変動は、問題サンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである場合もあり、後続のrunによる検証が必要である。
データ出典:YZ Index | Run #292 | 原データを確認
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接