2026-07-21 YZ Index Smokeクイックテストは11モデルを対象に実施され、Claude Sonnet 4.6とGPT-o3が96.27点で当日首位に並んだ。Smokeは毎日10問のクイックテストであり、短期シグナルの観察に適しているが、Fullの週間ランキング結論と同等ではない。
今回のSmokeテストはコード実行とマテリアル制約の2つのメインランキング次元のみをカバーしており、メインランキングの計算式は0.55 × コード実行 + 0.45 × マテリアル制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な結論としてではなく、モニタリングシグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | マテリアル制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Sonnet 4.6 | 96.27 | 100 | 91.7 | pass |
| #2 | GPT-o3 | 96.27 | 100 | 91.7 | pass |
| #3 | Doubao Pro | 92.49 | 100 | 83.3 | pass |
| #4 | Grok 4 | 88.8 | 93.3 | 83.3 | pass |
| #5 | DeepSeek V4 Pro | 87.87 | 86.7 | 89.3 | pass |
| #6 | GPT-5.5 | 87.67 | 100 | 72.6 | pass |
| #7 | Gemini 2.5 Pro | 80.21 | 70.8 | 91.7 | pass |
| #8 | Qwen3 Max | 79.42 | 85 | 72.6 | pass |
| #9 | Gemini 3.1 Pro | 75.9 | 78.6 | 72.6 | pass |
| #10 | Claude Opus 4.7 | 73.92 | 75 | 72.6 | pass |
| #11 | GLM-4.6 | 62.83 | 50 | 78.5 | pass |
データ解説
本日のメインランキング上位2位のClaude Sonnet 4.6とGPT-o3はいずれも96.27点を獲得し、コード実行はともに100、マテリアル制約はともに91.7で、コード実行とマテリアル制約のバランスが均整の取れた構造を示した。Doubao Proのコード実行も100、マテリアル制約83.3、メインランキング92.49;Grok 4のコード実行93.3、マテリアル制約83.3、メインランキング88.8;DeepSeek V4 Proのコード実行86.7、マテリアル制約89.3、メインランキング87.87となっており、各モデルの2指標における組み合わせの差異が浮き彫りになった。
Claude Sonnet 4.6は前回同条件runと比較してメインランキングが31.9点上昇、コード実行が28.1点上昇、マテリアル制約が36.5点上昇した;GPT-o3はメインランキングが13.6点上昇、コード実行が25点上昇;Qwen3 Maxはメインランキングが12.1点上昇、コード実行が19.4点上昇;Gemini 2.5 Proはメインランキングが10.2点上昇、コード実行が20.8点上昇した。一方、Claude Opus 4.7はメインランキングが26.1点急落、コード実行が25点下降、マテリアル制約が27.4点下降した。
Gemini 3.1 Proのマテリアル制約が17.8点急落、Claude Opus 4.7のメインランキングが26.1点急落、GLM-4.6のマテリアル制約が21.5点急落しており、これらの異常シグナルは問題のサンプリング変動によるものか、あるいは実際の性能劣化によるものかの可能性があり、後続のrunによる検証が必要である。Smokeクイックテストは小サンプルの単日シグナルであるため、関連する解釈は慎重に行うべきである。
主な変化
- Claude Sonnet 4.6:メインランキング+31.9点、コード実行+28.1点、マテリアル制約+36.5点
- Claude Opus 4.7:メインランキング-26.1点、コード実行-25点、マテリアル制約-27.4点
- GPT-o3:メインランキング+13.6点、コード実行+25点
- Qwen3 Max:メインランキング+12.1点、コード実行+19.4点、誠実性 warn→pass
- Gemini 2.5 Pro:メインランキング+10.2点、コード実行+20.8点
注目すべきシグナル
- Gemini 3.1 Pro:マテリアル制約が急落 -17.8点
- Claude Opus 4.7:メインランキングが急落 -26.1点
- GLM-4.6:マテリアル制約が急落 -21.5点
この種のSmoke速報を読む際は、2つの問いに焦点を当てるべきである:第一に、あるモデルが複数日連続して同種の弱点を露呈しているかどうか;第二に、誠実性評価がpassからwarnまたはfailに変化しているかどうか。単日のコード実行または制約スコアの大幅な変動は、問題のサンプリングによるものかもしれないが、実際の性能劣化の初期シグナルである可能性もあり、後続のrunによる検証が必要である。
データ出典:YZ Index | Run #240 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接