2026-08-30のYZ Index Smokeテストは11モデルを対象とし、Claude Opus 4.7が93.08点で当日首位となった。Smokeは1日10問の速測テストであり、短期シグナルの観察に適しているが、Full週次ランキングの結論とは同一ではない。
今回のSmoke評価はコード実行と資料制約の2つのメインランク次元のみをカバーしており、メインランクの算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な判断ではなく、モニタリングシグナルとして捉えることが適切である。
当日ランキング
| 順位 | モデル | メインランク | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 93.08 | 91.5 | 95 | pass |
| #2 | GLM-4.6 | 88.58 | 91.5 | 85 | pass |
| #3 | Grok 4 | 88.14 | 90.7 | 85 | pass |
| #4 | DeepSeek V4 Pro | 88.08 | 91.5 | 83.9 | pass |
| #5 | Doubao Pro | 85.89 | 90.7 | 80 | pass |
| #6 | Gemini 3.1 Pro | 85.83 | 91.5 | 78.9 | pass |
| #7 | Gemini 2.5 Pro | 85.73 | 94.5 | 75 | pass |
| #8 | Qwen3 Max | 80.07 | 91.5 | 66.1 | pass |
| #9 | Claude Sonnet 4.6 | 70.33 | 66.5 | 75 | pass |
| #10 | GPT-o3 | 69.56 | 66.5 | 73.3 | pass |
| #11 | GPT-5.5 | 63.08 | 66.5 | 58.9 | pass |
データ解説
当日メインランク上位5モデルのうち、Claude Opus 4.7はコード実行91.5・資料制約95の組み合わせでメインランク93.08を達成し、資料制約スコアは全モデル中最高となった。GLM-4.6とDeepSeek V4 Proも同様にコード実行91.5を記録したが、資料制約はそれぞれ85と83.9にとどまり、メインランクスコアは88.58と88.08となった。Gemini 2.5 Proはコード実行94.5を記録したものの資料制約は75にとどまり、メインランクは85.73となった。これはコード実行と資料制約の強弱の組み合わせが総合順位に直接影響することを示している。
GPT-o3はメインランクが13.7点低下し、うちコード実行が8.5点、資料制約が20点の下落となった。Claude Sonnet 4.6はメインランクが12.9点低下し、コード実行が8.5点、資料制約が18.3点の下落。Qwen3 Maxは資料制約が27.2点低下した。Gemini 3.1 Proはメインランクが10.8点低下し、コード実行が7.8点、資料制約が14.4点の下落となった。これらの変動は問題サンプリングのばらつきによる可能性もあれば、単日の実際のパフォーマンス差異による可能性もあり、同一条件での追加実行による検証が必要である。
異常シグナルとして、Grok 4のメインランクが8.8点急落、Gemini 3.1 Proが10.8点急落、Qwen3 Maxが11.8点急落、Claude Sonnet 4.6が12.9点急落、GPT-o3が13.7点急落、GPT-5.5の資料制約が16.7点急落した。Smokeテストは小サンプル単日シグナルであり、上記の変動はその安定性を検証するためにより多くの実行データが必要である。
主な変化
- GPT-o3:メインランク-13.7点、コード実行-8.5点、資料制約-20点
- Claude Sonnet 4.6:メインランク-12.9点、コード実行-8.5点、資料制約-18.3点
- Qwen3 Max:メインランク-11.8点、資料制約-27.2点
- Gemini 3.1 Pro:メインランク-10.8点、コード実行-7.8点、資料制約-14.4点
- Claude Opus 4.7:メインランク+9.8点、コード実行+16.5点
注目すべきシグナル
- Grok 4:メインランク急落 -8.8点
- Gemini 3.1 Pro:メインランク急落 -10.8点
- Qwen3 Max:メインランク急落 -11.8点
- Claude Sonnet 4.6:メインランク急落 -12.9点
- GPT-o3:メインランク急落 -13.7点
- GPT-5.5:資料制約急落 -16.7点
このようなSmoke速報を読む際には、2つの問いに焦点を当てるべきである。第一に、あるモデルが複数日連続して同種の弱点を露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行していないかどうか。単日のコード実行スコアや資料制約スコアの大幅な変動は、問題サンプリングによるものである可能性もあれば、実際の性能劣化の初期シグナルである可能性もあり、追加実行による検証が必要である。
データ出典:YZ Index | Run #300 | 原始データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接