2026年9月26日のYZ Index Smokeクイックテストは10モデルを対象とし、Doubao Proが92.85点で当日首位となった。Smokeは毎日10問のクイックテストであり、短期シグナルの観測に適しているが、Fullウィークリーランキングの結論とは同等ではない。
今回のSmokeテストはコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの計算式は 0.55 × コード実行 + 0.45 × 資料制約 である。日次サンプル数が少ないため、単日のスコアはモデル能力に関する長期的な評価としてではなく、モニタリングシグナルとして活用することが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Doubao Pro | 92.85 | 98.7 | 85.7 | pass |
| #2 | GPT-5.5 | 91.32 | 100 | 80.7 | pass |
| #3 | Claude Opus 4.7 | 89.47 | 100 | 76.6 | pass |
| #4 | GPT-o3 | 87.22 | 100 | 71.6 | pass |
| #5 | Claude Sonnet 4.6 | 86.1 | 95.5 | 74.6 | pass |
| #6 | Gemini 2.5 Pro | 80.35 | 87.5 | 71.6 | pass |
| #7 | DeepSeek V4 Pro | 77.57 | 75 | 80.7 | pass |
| #8 | Qwen3 Max | 75.45 | 76.8 | 73.8 | pass |
| #9 | Gemini 3.1 Pro | 73.47 | 75 | 71.6 | pass |
| #10 | Grok 4 | 70.41 | 75 | 64.8 | pass |
データ解説
本日のYZ Index Smokeクイックテストでは、Doubao Proがメインランキング92.85で首位となった。コード実行98.7と資料制約85.7の組み合わせは、両次元において相対的にバランスの取れた特性を示している。GPT-5.5はメインランキング91.32で、コード実行100・資料制約80.7と、高いコード実行スコアを武器に上位を維持している。Claude Opus 4.7のメインランキング89.47、GPT-o3の87.22、Claude Sonnet 4.6の86.1はいずれもコード実行が100または95.5と高い一方、資料制約はそれぞれ76.6・71.6・74.6にとどまっており、この構造がメインランキング計算式(0.55×コード実行+0.45×資料制約)において上位獲得につながっている。
前回同条件の実行と比較すると、Claude Sonnet 4.6はメインランキングが18.3点上昇し、主にコード実行が45.5点増加した一方で資料制約が14.9点低下した。Doubao Proはメインランキングが15.9点増加し、コード実行が32点上昇した。Qwen3 Maxはメインランキングが15.2点増加し、コード実行が28.7点上昇した。GPT-o3はメインランキングが14.7点増加し、コード実行が50点上昇した一方で資料制約が28.4点低下した。Gemini 2.5 Proはメインランキングが12.6点増加し、コード実行が37.5点上昇した一方で資料制約が17.9点低下した。これらの変動は単日の問題サンプリングのばらつきによる可能性があり、また資料制約次元におけるモデルの一時的な性能差を反映している可能性もあるため、シグナルの安定性を確認するべく後続の実行での再検証が必要である。
Smokeクイックテストは小サンプルの単日シグナルであり、上記のスコア構造と変化はあくまで当日の観測用である。慎重な解釈がモデル全体の状態に関する過度な推測を避けることに役立つ。
主な変化
- Claude Sonnet 4.6:メインランキング+18.3点、コード実行+45.5点、資料制約-14.9点
- Doubao Pro:メインランキング+15.9点、コード実行+32点
- Qwen3 Max:メインランキング+15.2点、コード実行+28.7点
- GPT-o3:メインランキング+14.7点、コード実行+50点、資料制約-28.4点
- Gemini 2.5 Pro:メインランキング+12.6点、コード実行+37.5点、資料制約-17.9点
注目すべきシグナル
- 今回は公表すべき異常シグナルはなかった。
このようなSmoke速報を読む際は、主に2点に注目すべきである。第一に、あるモデルが複数日連続して同種の弱点を露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行していないかどうか。単日のコード実行または資料制約スコアの大幅な変化は、問題のサンプリングによるものである可能性もあれば、実際の性能低下の初期シグナルである可能性もあり、後続の実行での再検証が必要である。
データ出典:YZ Index | Run #339 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接