2026-08-31 YZ Index Smoke速測は11モデルを対象とし、Grok 4が89.15点で当日首位となった。Smokeは1日10問の速測であり、短期シグナルの観察に適しており、Fullウィークリーランキングの結論とは同一視できない。
今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの計算式は 0.55 × コード実行 + 0.45 × 資料制約 である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価ではなく、モニタリングシグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Grok 4 | 89.15 | 94.5 | 82.6 | pass |
| #2 | Doubao Pro | 86.9 | 94.5 | 77.6 | pass |
| #3 | GPT-5.5 | 86.18 | 94.5 | 76 | pass |
| #4 | GPT-o3 | 80.91 | 94.5 | 64.3 | pass |
| #5 | Claude Opus 4.7 | 75.4 | 69.5 | 82.6 | pass |
| #6 | Claude Sonnet 4.6 | 75.4 | 69.5 | 82.6 | pass |
| #7 | Qwen3 Max | 75.4 | 69.5 | 82.6 | pass |
| #8 | Gemini 3.1 Pro | 66.21 | 52.8 | 82.6 | pass |
| #9 | DeepSeek V4 Pro | 61.65 | 44.5 | 82.6 | pass |
| #10 | Gemini 2.5 Pro | 61.65 | 44.5 | 82.6 | pass |
| #11 | GLM-4.6 | 61.65 | 44.5 | 82.6 | warn |
データ解説
本日のメインランキング上位3モデルは、コード実行と資料制約の組み合わせにおいて明確な差異を示している。Grok 4はコード実行94.5・資料制約82.6でメインランキング89.15を獲得し、Doubao ProとGPT-5.5も同じくコード実行94.5だが、資料制約はそれぞれ77.6と76で、メインランキングはそれぞれ86.9と86.18となった。Claude Opus 4.7・Claude Sonnet 4.6・Qwen3 Maxの3モデルはコード実行69.5・資料制約82.6で並び、メインランキングは同じく75.4となった。Gemini 3.1 Proはコード実行52.8・資料制約82.6でメインランキング66.21。DeepSeek V4 Pro・Gemini 2.5 Pro・GLM-4.6の3モデルはいずれもコード実行44.5・資料制約82.6で、メインランキングはそれぞれ61.65・61.65・61.65となった。
直近の同条件runとの比較では、GLM-4.6のメインランキングが26.9点低下・コード実行が47点低下し、誠実性評価がpassからwarnに変化した。DeepSeek V4 Proはメインランキングが26.4点低下・コード実行が47点低下。Gemini 2.5 Proはメインランキングが24.1点低下・コード実行が50点低下・資料制約が7.6点上昇。GPT-5.5はメインランキングが23.1点上昇・コード実行が28点上昇・資料制約が17.1点上昇。Gemini 3.1 Proはメインランキングが19.6点低下・コード実行が38.7点低下となった。Smokeは小サンプルの日次シグナルであり、上記のスコア変動は問題サンプリングの変動に起因する可能性もあれば、実際の性能劣化を反映している可能性もあるため、後続runによる安定性の確認が必要である。
全体として、コード実行94.5の3モデルがメインランキングで上位を占め、コード実行69.5の3モデルがそれに続き、コード実行52.8以下のモデルはランキング下位となった。同じコード実行水準では、資料制約82.6のモデルのメインランキングスコアは同一である。GLM-4.6の誠実性評価がwarnとなった点を除き、その他すべてのモデルはpassとなっている。
主な変化
- GLM-4.6:メインランキング-26.9点、コード実行-47点、誠実性 pass→warn
- DeepSeek V4 Pro:メインランキング-26.4点、コード実行-47点
- Gemini 2.5 Pro:メインランキング-24.1点、コード実行-50点、資料制約+7.6点
- GPT-5.5:メインランキング+23.1点、コード実行+28点、資料制約+17.1点
- Gemini 3.1 Pro:メインランキング-19.6点、コード実行-38.7点
注目すべきシグナル
- 今回は公表可能な異常シグナルは確認されなかった。
このようなSmoke速報を読む際には、2つの点に着目すべきである。第一に、特定のモデルが複数日連続して同種の弱点を露呈していないか。第二に、誠実性評価がpassからwarnまたはfailに移行していないか。単日のコード実行または資料制約スコアの大幅な変動は、問題サンプリングに起因する場合もあれば、実際の性能劣化の早期シグナルである場合もあるため、後続runによる確認が必要である。
データ提供:YZ Index | Run #302 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接