2026-09-20のYZ Index Smoke速測は10モデルを対象とし、Claude Opus 4.7が96.99点で当日首位となった。Smokeは毎日10問の速測であり、短期的なシグナルの観察に適しており、Fullウィーク総合ランキングの結論とは同一ではない。
今回のSmoke評価はコード実行とマテリアル制約の2つのメインランキング指標のみを対象とし、メインランキングの算出式は0.55 × コード実行 + 0.45 × マテリアル制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な結論としてではなく、モニタリングシグナルとして活用することが適切である。
当日ランキング
| 順位 | モデル | 総合スコア | コード実行 | マテリアル制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 96.99 | 100 | 93.3 | pass |
| #2 | Doubao Pro | 94.35 | 99.3 | 88.3 | pass |
| #3 | Claude Sonnet 4.6 | 89.52 | 100 | 76.7 | pass |
| #4 | Qwen3 Max | 89.52 | 100 | 76.7 | pass |
| #5 | GPT-5.5 | 86.5 | 100 | 70 | pass |
| #6 | DeepSeek V4 Pro | 75.77 | 75 | 76.7 | pass |
| #7 | Gemini 3.1 Pro | 75.38 | 74.3 | 76.7 | pass |
| #8 | Grok 4 | 75.38 | 74.3 | 76.7 | pass |
| #9 | GPT-o3 | 72.75 | 75 | 70 | pass |
| #10 | Gemini 2.5 Pro | 67.24 | 50 | 88.3 | pass |
データ解説
スコア構成を見ると、Claude Opus 4.7はコード実行100・マテリアル制約93.3で総合96.99を獲得し、Doubao Proはコード実行99.3・マテリアル制約88.3で94.35を獲得しており、両者は2指標においてバランスの取れた組み合わせを示している。Claude Sonnet 4.6とQwen3 Maxはともにコード実行100・マテリアル制約76.7で89.52に並び、GPT-5.5はコード実行100・マテリアル制約70で86.5となっており、上位モデルはコード実行が高水準でマテリアル制約が中上位という傾向が見られる。
DeepSeek V4 Proの総合スコアは前回比20.8点上昇し、うちコード実行は50点上昇して75、マテリアル制約は15点下落して76.7となった。Doubao Proは総合17.5点上昇、マテリアル制約は34.8点上昇して88.3。Gemini 3.1 Proは総合16.5点上昇、コード実行は24.3点上昇して74.3となった。Grok 4は総合13点下落、コード実行は22.4点下落して74.3。Gemini 2.5 Proはコード実行が23.7点下落して50となった。GLM-4.6は指標データが不完全なためランキング対象外となっている。
マテリアル制約が15点急落したDeepSeek V4 Pro、総合が13点急落したGrok 4、コード実行が23.7点急落したGemini 2.5 Proの異常シグナルは、単日の問題抽出サンプリングによる変動である可能性もあれば、実際のパフォーマンス低下である可能性もあり、今後の追加実行による確認が必要である。Smoke速測は小サンプルの単日シグナルであるため、以上の解説は慎重に扱い、長期的な判断は行わない。
主な変動
- DeepSeek V4 Pro:総合+20.8点、コード実行+50点、マテリアル制約-15点
- Doubao Pro:総合+17.5点、マテリアル制約+34.8点
- Gemini 3.1 Pro:総合+16.5点、コード実行+24.3点、マテリアル制約+6.9点
- Grok 4:総合-13点、コード実行-22.4点、誠実性 warn→pass
- Qwen3 Max:総合+12.5点、マテリアル制約+26.2点、誠実性 warn→pass
注目すべきシグナル
- DeepSeek V4 Pro:マテリアル制約が急落 -15点
- Grok 4:総合スコアが急落 -13点
- Gemini 2.5 Pro:コード実行が急落 -23.7点
- GLM-4.6:データ不完全(複数の評価次元でAPIエラー/タイムアウトが発生)のため自動補完実行待ちとなり、今回のランキング対象外
このようなSmoke速報を読む際は、2点に注目すべきである。第一に、あるモデルが複数日連続して同種の弱点を示しているか否か。第二に、誠実性評価がpassからwarnまたはfailへ移行しているか否か。単日のコード実行スコアや制約スコアの大幅な変動は、問題サンプリングによるものである場合も、実際の性能低下の早期シグナルである場合もあり、今後の追加実行による確認が必要である。
データ出典:YZ Index | Run #330 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接