2026-09-04のYZ Index Smokeクイックテストは11モデルを対象とし、Claude Opus 4.7が92.49点で当日首位となった。Smokeは毎日10問のクイックテストで、短期的なシグナルの観察に適しており、Full週間ランキングの結論と同一ではない。
今回のSmoke評価は、コード実行と資料制約という2つの主要ランキング指標のみを対象としており、主要ランキングの算式は0.55 × コード実行 + 0.45 × 資料制約である。日次のサンプル数が少ないため、単日のスコアはモデル能力について長期的な結論を下すものではなく、監視シグナルとして見るのがより適切である。
当日の順位
| 順位 | モデル | 主要ランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 92.49 | 100 | 83.3 | pass |
| #2 | Grok 4 | 89.38 | 100 | 76.4 | pass |
| #3 | GPT-o3 | 82.47 | 97.5 | 64.1 | pass |
| #4 | Gemini 2.5 Pro | 75.45 | 75 | 76 | pass |
| #5 | Qwen3 Max | 75.15 | 96.7 | 48.8 | pass |
| #6 | GPT-5.5 | 71.67 | 75 | 67.6 | pass |
| #7 | DeepSeek V4 Pro | 67.24 | 50 | 88.3 | pass |
| #8 | GLM-4.6 | 60.94 | 50 | 74.3 | pass |
| #9 | Gemini 3.1 Pro | 60.65 | 75 | 43.1 | pass |
| #10 | Claude Sonnet 4.6 | 52.16 | 50 | 54.8 | pass |
| #11 | Doubao Pro | 50.09 | 50 | 50.2 | pass |
データ解釈
本日の主要ランキング上位3モデルは、コード実行と資料制約の2指標で異なる組み合わせを示した。Claude Opus 4.7はコード実行100、資料制約83.3で主要ランキング92.49を獲得し、Grok 4も同じくコード実行100だったが資料制約は76.4で、主要ランキングは89.38だった。GPT-o3はコード実行97.5、資料制約64.1で、主要ランキング82.47となった。3モデルはいずれも誠実性がpassだった。DeepSeek V4 Proはコード実行50、資料制約88.3で、主要ランキング67.24となり、資料制約が相対的に強い構造的特徴を示した。Gemini 2.5 Proはコード実行75、資料制約76、主要ランキング75.45で、2項目が比較的均衡した位置にある。
複数のモデルで、同一基準における明確な変化が見られた。Claude Opus 4.7は主要ランキングが+33.6点、コード実行が+25点、資料制約が+44点。Grok 4は主要ランキングが+27.4点、コード実行が+25点、資料制約が+30.3点。Gemini 2.5 Proは主要ランキングが+27.9点、コード実行が+25点、資料制約が+31.5点。DeepSeek V4 Proは主要ランキングが+22.1点、資料制約が+49点だった。Doubao Proは主要ランキングが-29点、コード実行が-50点だった。これらの単日での変動幅は、Smokeの小サンプルという特性と合わせて見る必要があり、設問サンプリングの揺れに起因する可能性も、実際の性能変化を反映している可能性もあるため、いずれも後続のrunでの再確認が必要である。
異常シグナルはいくつかのモデルに集中した。GPT-5.5はコード実行が-25点と急落し、GLM-4.6は誠実性評価がfailからFailに転じ、Claude Sonnet 4.6は主要ランキングが-13.9点と急落し、Doubao Proは主要ランキングが-29点と急落した。以上の変動は小サンプルの単日テストではよく見られるものであり、現時点では長期的な劣化と見なすべきではなく、観察シグナルとして扱い、複数回の反復テストを通じてさらに検証することが推奨される。
主な変化
- Claude Opus 4.7:主要ランキングが33.6点上昇、コード実行+25点、資料制約+44点
- Doubao Pro:主要ランキングが29点低下、コード実行-50点
- Gemini 2.5 Pro:主要ランキングが27.9点上昇、コード実行+25点、資料制約+31.5点
- Grok 4:主要ランキングが27.4点上昇、コード実行+25点、資料制約+30.3点
- DeepSeek V4 Pro:主要ランキングが22.1点上昇、資料制約+49点
注目すべきシグナル
- GPT-5.5:コード実行が -25 点と急落
- GLM-4.6:誠実性評価が Fail に低下(fail→pass)
- Claude Sonnet 4.6:主要ランキングが -13.9 点と急落
- Doubao Pro:主要ランキングが -29 点と急落
この種のSmoke概要を読む際は、重点を2つの問題に置くべきである。第一に、あるモデルが連日にわたり同じ種類の弱点を露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうかである。単日の実行スコアや制約スコアの大幅な変化は、設問サンプリングに由来する可能性もあれば、実際の劣化の初期シグナルである可能性もあり、後続のrunでの再確認が必要である。
データ出典:YZ Index | Run #308 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接