2026-08-26のYZ Index Smoke速測は11モデルをカバーし、GPT-o3が97.75点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適しており、Full週間ランキングの結論と同等ではない。
今回のSmokeテストはコード実行とマテリアル制約の2つのメインランキング指標のみをカバーしており、メインランキングの計算式は0.55 × コード実行 + 0.45 × マテリアル制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価ではなく、監視シグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | マテリアル制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | GPT-o3 | 97.75 | 100 | 95 | pass |
| #2 | Gemini 2.5 Pro | 96.1 | 97 | 95 | pass |
| #3 | Grok 4 | 95.17 | 95.3 | 95 | pass |
| #4 | Doubao Pro | 86.25 | 75 | 100 | pass |
| #5 | Claude Sonnet 4.6 | 85.54 | 73.7 | 100 | pass |
| #6 | DeepSeek V4 Pro | 84 | 75 | 95 | pass |
| #7 | Gemini 3.1 Pro | 84 | 75 | 95 | pass |
| #8 | GPT-5.5 | 84 | 75 | 95 | pass |
| #9 | Claude Opus 4.7 | 79.91 | 75 | 85.9 | pass |
| #10 | Qwen3 Max | 79.19 | 73.7 | 85.9 | pass |
| #11 | GLM-4.6 | 47.63 | 37.5 | 60 | pass |
データの読み解き
本日のYZ Index Smoke速測では、上位モデルのコード実行とマテリアル制約の組み合わせに明確な差異が見られた。GPT-o3はコード実行100・マテリアル制約95でメインランキング97.75を獲得、Gemini 2.5 Proはコード実行97・マテリアル制約95でメインランキング96.1、Grok 4はコード実行95.3・マテリアル制約95でメインランキング95.17となり、3モデルともに両指標で高い均衡水準を維持した。一方、Doubao Proはコード実行75・マテリアル制約100でメインランキング86.25、Claude Sonnet 4.6はコード実行73.7・マテリアル制約100でメインランキング85.54となり、マテリアル制約が満点である一方でコード実行が相対的に低いという構造的特徴を示した。
複数のモデルで顕著な変動が見られた。DeepSeek V4 Proはメインランキング+27.3点・コード実行+33.3点・マテリアル制約+20点、Gemini 2.5 Proはメインランキング+21.1点・コード実行+22点・マテリアル制約+20点、Gemini 3.1 Proはメインランキング+13.6点・コード実行+8.3点・マテリアル制約+20点、Grok 4はメインランキング+11.8点・コード実行+20.3点、GPT-o3はメインランキング+11.5点・コード実行+25点・マテリアル制約-5点となった。これらの単日変動は問題のサンプリングによるばらつきに起因する可能性もあれば、特定タスクにおけるモデルの実際のパフォーマンス差を反映している可能性もあり、同条件での再実行による検証が必要である。
異常シグナルとして、Doubao Proのコード実行が16.7点の急落を記録した一方、マテリアル制約は100を維持し、メインランキングは86.25となった。この種の小サンプル単日シグナルは過度な解釈を避け、慎重に扱う必要がある。
主な変動
- DeepSeek V4 Pro:メインランキング+27.3点、コード実行+33.3点、マテリアル制約+20点
- Gemini 2.5 Pro:メインランキング+21.1点、コード実行+22点、マテリアル制約+20点
- Gemini 3.1 Pro:メインランキング+13.6点、コード実行+8.3点、マテリアル制約+20点
- Grok 4:メインランキング+11.8点、コード実行+20.3点
- GPT-o3:メインランキング+11.5点、コード実行+25点、マテリアル制約-5点
注目すべきシグナル
- Doubao Pro:コード実行が急落 -16.7点
この種のSmokeブリーフィングを読む際は、2つの点に重点を置くべきである。第一に、特定のモデルが複数日連続して同種の弱点を露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに変化していないかどうか。単日のコード実行またはマテリアル制約スコアの大幅な変動は、問題のサンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである可能性もあり、後続の再実行による検証が必要である。
データソース:YZ Index | Run #295 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接