2026年9月5日、YZ Index Smoke速測は11モデルを対象に実施され、GPT-o3が90.64点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適しており、フル週次ランキングの結論とは同列に扱えない。
今回のSmoke評価はコード実行と資料制約の2つのメインランキング指標のみを対象としており、メインランキングの計算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価ではなく、モニタリングシグナルとして参照するのが適切である。
当日ランキング
| 順位 | モデル | メイン | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | GPT-o3 | 90.64 | 100 | 79.2 | pass |
| #2 | Claude Opus 4.7 | 86.14 | 100 | 69.2 | pass |
| #3 | Doubao Pro | 83.94 | 96 | 69.2 | pass |
| #4 | Grok 4 | 83.63 | 98.7 | 65.2 | warn |
| #5 | GPT-5.5 | 83.17 | 100 | 62.6 | pass |
| #6 | Claude Sonnet 4.6 | 79.13 | 98.7 | 55.2 | pass |
| #7 | Qwen3 Max | 72.39 | 75 | 69.2 | warn |
| #8 | Gemini 3.1 Pro | 67.58 | 75 | 58.5 | pass |
| #9 | GLM-4.6 | 65.24 | 75 | 53.3 | warn |
| #10 | DeepSeek V4 Pro | 60.89 | 50 | 74.2 | pass |
| #11 | Gemini 2.5 Pro | 56.84 | 50 | 65.2 | pass |
データ解説
本日のYZ Index Smoke速測では、上位モデルのコード実行と資料制約の組み合わせに明確な差異が見られた。GPT-o3のメインスコアは90.64で、コード実行100・資料制約79.2を記録。Claude Opus 4.7はメイン86.14で、コード実行同じく100・資料制約69.2。Doubao Proはメイン83.94で、コード実行96・資料制約69.2となった。これらのモデルはコード実行において高い水準を維持しつつ、資料制約でも比較的バランスの取れたスコアを示しており、現在のメインランキング上位3位の中核的な構造を形成している。Grok 4とGPT-5.5は、それぞれコード実行98.7・100でメイン順位を支えているものの、資料制約はそれぞれ65.2・62.6にとどまり、コード実行寄りの特性が見受けられる。
顕著な変化については、Doubao Proのメインスコアが前回同条件の実行と比べ33.9点上昇し、コード実行+46点・資料制約+19点を記録。Claude Sonnet 4.6はメイン+27点・コード実行+48.7点。GPT-5.5はメイン+11.5点・コード実行+25点・資料制約-5点。GPT-o3はメイン+8.2点・資料制約+15.1点となった。一方でGemini 2.5 Proはメイン-18.6点・コード実行-25点・資料制約-10.8点の下落となった。異常シグナルとして、Qwen3 Maxのコード実行が-21.7点の急落、GLM-4.6の資料制約が-21点の急落、Gemini 2.5 Proのメインが-18.6点の急落を記録した。これらの単日変動は設問のサンプリング揺らぎに起因する可能性もあるが、真の性能低下を反映している可能性もあり、後続実行による確認が必要である。
Smoke速測は小サンプルの単日シグナルであり、上記のスコア構造および変動はあくまで当日の観察用途にとどまり、長期的な判断の根拠とはならない。
主な変化
- Doubao Pro:メイン+33.9点、コード実行+46点、資料制約+19点
- Claude Sonnet 4.6:メイン+27点、コード実行+48.7点
- Gemini 2.5 Pro:メイン-18.6点、コード実行-25点、資料制約-10.8点
- GPT-5.5:メイン+11.5点、コード実行+25点、資料制約-5点
- GPT-o3:メイン+8.2点、資料制約+15.1点
注目すべきシグナル
- Qwen3 Max:コード実行が急落 -21.7点
- GLM-4.6:資料制約が急落 -21点
- Gemini 2.5 Pro:メインが急落 -18.6点
この種のSmokeブリーフィングを読む際は、2点に注目すべきである。第一に、あるモデルが複数日連続して同種の弱点を露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに変化しているかどうか。単日のコード実行または資料制約スコアの大幅な変動は、設問サンプリングによるものである場合もあれば、真の性能低下の初期シグナルである場合もあり、後続実行による確認が求められる。
データ出典:YZ Index | Run #309 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接