2026年9月11日のYZ Index Smokeクイックテストは10モデルを対象とし、Doubao Proが95.28点で当日首位を獲得した。Smokeは毎日10問のクイックテストであり、短期的なシグナルの観測に適しているが、Fullウィークリーランキングの結論と同一ではない。
今回のSmokeテストはコード実行とマテリアル制約の2つのメインランキング指標のみを対象とし、メインランキングの算出式は 0.55 × コード実行 + 0.45 × マテリアル制約 である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な評価としてではなく、モニタリングシグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | マテリアル制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Doubao Pro | 95.28 | 100 | 89.5 | pass |
| #2 | Gemini 3.1 Pro | 93.48 | 100 | 85.5 | pass |
| #3 | GPT-o3 | 93.48 | 100 | 85.5 | pass |
| #4 | GPT-5.5 | 90.82 | 83.3 | 100 | pass |
| #5 | Grok 4 | 88.64 | 97.5 | 77.8 | pass |
| #6 | DeepSeek V4 Pro | 86.09 | 83.3 | 89.5 | pass |
| #7 | Gemini 2.5 Pro | 81.53 | 75 | 89.5 | pass |
| #8 | Claude Opus 4.7 | 79.1 | 75 | 84.1 | pass |
| #9 | Claude Sonnet 4.6 | 74.89 | 72.5 | 77.8 | pass |
| #10 | Qwen3 Max | 70.91 | 75 | 65.9 | pass |
データ解説
本日のYZ Index Smokeクイックテストでは、Doubao Proがメインランキング95.28で首位を獲得し、コード実行100・マテリアル制約89.5という組み合わせによるバランスの取れた優位性を示した。Gemini 3.1 ProとGPT-o3はともにメインランキング93.48で並び、コード実行・マテリアル制約ともに同スコアで、コード実行重視の構造的特徴を示している。GPT-5.5はメインランキング90.82で、マテリアル制約100・コード実行83.3という相互補完的な構成となっており、上位モデル間では2指標における強弱の組み合わせに明確な分化が見られる。
前回同条件のrunと比較すると、GPT-o3はメインランキング+15.4点・コード実行+30.2点、Gemini 2.5 Proはメインランキング-7.2点・コード実行-25点・マテリアル制約+14.5点、GPT-5.5はメインランキング+6.2点・コード実行+11.3点、Grok 4はメインランキング-5.2点・コード実行+8.8点・マテリアル制約-22.2点、Claude Opus 4.7はメインランキング+5.2点・コード実行+22.4点・マテリアル制約-15.9点となった。これらの変動のうち、Grok 4のマテリアル制約-22.2点、Gemini 2.5 Proのコード実行-25点、Claude Opus 4.7のマテリアル制約-15.9点は異常シグナルを構成しており、問題サンプリングの変動に起因する可能性もあれば、実際の性能低下の兆候である可能性もあり、後続runによる確認が必要である。
GLM-4.6はAPIの障害・タイムアウトによりデータが不完全となったため、今回はランキングに参加していない。Smokeは小サンプルの単日シグナルであり、以上の観察はあくまで当日のスコア構造を反映するものであり、長期的な推論は行わない。
主な変化
- GPT-o3:メインランキング+15.4点、コード実行+30.2点
- Gemini 2.5 Pro:メインランキング-7.2点、コード実行-25点、マテリアル制約+14.5点
- GPT-5.5:メインランキング+6.2点、コード実行+11.3点
- Grok 4:メインランキング-5.2点、コード実行+8.8点、マテリアル制約-22.2点
- Claude Opus 4.7:メインランキング+5.2点、コード実行+22.4点、マテリアル制約-15.9点
注目すべきシグナル
- Grok 4:マテリアル制約が急落 -22.2点
- Gemini 2.5 Pro:コード実行が急落 -25点
- Claude Opus 4.7:マテリアル制約が急落 -15.9点
- GLM-4.6:データ不完全(API障害・タイムアウトにより複数指標でデータ欠損)、自動再テストに移行、今回はランキング不参加
このようなSmokeレポートを読む際は、主に2点に着目すべきである。第一に、あるモデルが複数日にわたって同種の弱点を継続的に示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに転じているかどうか。単日のコード実行またはマテリアル制約スコアの大幅な変動は、問題サンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである場合もあり、後続runによる確認が必要である。
データ出典:YZ Index | Run #318 | 元データを確認
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接