2026-09-10 YZ Index Smoke速測は10モデルを対象とし、Gemini 3.1 Proが98.35点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適しており、Fullウィークリーランキングの結論とは同一ではない。
今回のSmoke評価はコード実行と材料制約の2つのメインランキング次元のみをカバーし、メインランキングの計算式は 0.55 × コード実行 + 0.45 × 材料制約 である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な判断よりも、モニタリングシグナルとして参照するのが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 材料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Gemini 3.1 Pro | 98.35 | 97 | 100 | pass |
| #2 | Doubao Pro | 94.45 | 91.7 | 97.8 | pass |
| #3 | Grok 4 | 93.79 | 88.7 | 100 | pass |
| #4 | Gemini 2.5 Pro | 88.75 | 100 | 75 | pass |
| #5 | DeepSeek V4 Pro | 86.25 | 75 | 100 | pass |
| #6 | GPT-5.5 | 84.6 | 72 | 100 | pass |
| #7 | GPT-o3 | 78.13 | 69.8 | 88.3 | pass |
| #8 | Claude Opus 4.7 | 73.93 | 52.6 | 100 | pass |
| #9 | Claude Sonnet 4.6 | 73.35 | 72 | 75 | pass |
| #10 | Qwen3 Max | 71.34 | 70.8 | 72 | pass |
データ解説
本日のYZ Index Smoke速測では、Gemini 3.1 Proがメインランキング98.35で首位となり、コード実行97・材料制約100というバランスの取れた高水準の組み合わせを示した。Doubao Proはメインランキング94.45・コード実行91.7・材料制約97.8で続き、Grok 4はメインランキング93.79・コード実行88.7・材料制約100と材料制約満点の強みを見せた。Gemini 2.5 Proはメインランキング88.75・コード実行100ながら材料制約75、DeepSeek V4 Proはメインランキング86.25・コード実行75・材料制約100と材料制約主導の構造的特徴を示した。
前回同条件の実行と比較すると、Gemini 3.1 Proはメインランキング+24.1点・コード実行+20.5点・材料制約+28.6点、Gemini 2.5 Proはメインランキング+15.2点・コード実行+30.5点、DeepSeek V4 Proはメインランキング+9.8点・コード実行+5.5点・材料制約+15点と、上位モデルがコード実行と材料制約の両次元で同時に向上していることが示された。一方、Claude Sonnet 4.6はメインランキング-8.5点・コード実行-22.5点・材料制約+8.6点、GPT-o3はメインランキング-7.9点・コード実行-24.7点・材料制約+12.6点と、異常シグナルがコード実行の急落に集中している。
GPT-5.5のコード実行急落-22.5点、GPT-o3のコード実行急落-24.7点、Claude Opus 4.7のコード実行急落-16.9点、Claude Sonnet 4.6のメインランキング急落-8.5点は、問題サンプリングの変動に起因する可能性もあれば、実際の性能低下の初期シグナルである可能性もあり、後続の実行による確認が必要である。GLM-4.6はデータ不完全のためランキング対象外となった。Smokeは小サンプルの単日シグナルであり、上記の変動は当日の観察として参照されたい。
主な変動
- Gemini 3.1 Pro:メインランキング+24.1点、コード実行+20.5点、材料制約+28.6点
- Gemini 2.5 Pro:メインランキング+15.2点、コード実行+30.5点
- DeepSeek V4 Pro:メインランキング+9.8点、コード実行+5.5点、材料制約+15点
- Claude Sonnet 4.6:メインランキング-8.5点、コード実行-22.5点、材料制約+8.6点
- GPT-o3:メインランキング-7.9点、コード実行-24.7点、材料制約+12.6点
注目すべきシグナル
- GPT-5.5:コード実行急落 -22.5点
- GPT-o3:コード実行急落 -24.7点
- Claude Opus 4.7:コード実行急落 -16.9点
- Claude Sonnet 4.6:メインランキング急落 -8.5点
- GLM-4.6:データ不完全(複数次元でAPI障害・タイムアウトが発生)のため自動再実行待ちとなり、今回はランキング対象外
このようなSmoke速報を読む際には、2点に重点を置くべきである。第一に、あるモデルが複数日連続して同種の弱点を示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに変化していないかどうか。単日のコード実行や材料制約スコアの大幅な変動は、問題サンプリングに起因する場合も、実際の性能低下の初期シグナルである場合もあり、後続の実行による確認が必要である。
データ提供:YZ Index | Run #317 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接