2026-10-12 YZ Index Smokeテストは14モデルを対象に実施し、GPT-6 AstraとGPT-6.1 Solがいずれも84.99点で当日首位に並んだ。Smokeは毎日10問の速報テストであり、短期シグナルの観察に適しており、Full週次ランキングの結論とは同等ではない。
今回のSmokeテストはコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの算式は 0.55 × コード実行 + 0.45 × 資料制約 である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な評価よりも、監視シグナルとして参照するのが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | GPT-6 Astra | 84.99 | 97 | 70.3 | pass |
| #2 | GPT-6.1 Sol | 84.99 | 97 | 70.3 | pass |
| #3 | Doubao Pro | 84.66 | 91.5 | 76.3 | pass |
| #4 | GPT-6 Sol | 82.79 | 94.8 | 68.1 | pass |
| #5 | GPT-6 Luna | 78.55 | 97 | 56 | pass |
| #6 | Claude Sonnet 4.6 | 73.94 | 72 | 76.3 | pass |
| #7 | DeepSeek V4 Pro | 72.59 | 72 | 73.3 | pass |
| #8 | GPT-5.5 | 72.59 | 72 | 73.3 | pass |
| #9 | Gemini 3.1 Pro | 71.6 | 72 | 71.1 | pass |
| #10 | GPT-o3 | 71.38 | 69.8 | 73.3 | pass |
| #11 | Gemini 2.5 Pro | 71.21 | 69.5 | 73.3 | pass |
| #12 | Grok 4 | 68.02 | 63.7 | 73.3 | pass |
| #13 | Claude Opus 4.7 | 58.84 | 47 | 73.3 | pass |
| #14 | GLM-4.6 | 41.18 | 16.7 | 71.1 | pass |
データ解説
本日のメインランキング上位2位であるGPT-6 AstraとGPT-6.1 Solはいずれもコード実行97・資料制約70.3という構成を示し、メインランキングも同じく84.99となった。Doubao Proはコード実行91.5・資料制約76.3でメインランキング84.66となり、資料制約が相対的に強い組み合わせを示している。GPT-6 Lunaはコード実行97・資料制約56でメインランキング78.55となり、コード実行が主導する特徴を体現している。Claude Sonnet 4.6はコード実行72・資料制約76.3でメインランキング73.94となり、DeepSeek V4 ProおよびGPT-5.5と同じ資料制約73.3のスコア帯と対照をなしている。
Doubao Proはメインランキング+29.9点・コード実行+44.5点・資料制約+12点、GPT-5.5はメインランキング+24.2点・コード実行+25点・資料制約+23.3点、DeepSeek V4 Proはメインランキング+23.1点・コード実行+25点・資料制約+20.7点、GPT-6 Solはメインランキング+16.8点・コード実行+47.8点・資料制約-21.2点となり、単日のコード実行と資料制約の組み合わせに顕著な変動が見られる。GPT-6 Astraの資料制約が-19点の急落、GPT-6.1 Solの資料制約が-19点の急落、Gemini 2.5 Proの資料制約が-16点の急落、Claude Opus 4.7のメインランキングが-21点の急落、GLM-4.6のメインランキングが-13.6点の急落といった異常シグナルは、問題のサンプリング変動に起因する可能性もあれば、実際の性能劣化の兆候である可能性もあり、後続の実行による再確認が必要である。
Smokeは小サンプルの日次シグナルであり、以上の解説は当日のデータ構造のみに基づくものであり、長期的な判断は行わない。
主な変化
- Doubao Pro:メインランキング+29.9点、コード実行+44.5点、資料制約+12点
- GPT-5.5:メインランキング+24.2点、コード実行+25点、資料制約+23.3点
- DeepSeek V4 Pro:メインランキング+23.1点、コード実行+25点、資料制約+20.7点
- Claude Opus 4.7:メインランキング-21点、コード実行-25点、資料制約-16点
- GPT-6 Sol:メインランキング+16.8点、コード実行+47.8点、資料制約-21.2点
注目すべきシグナル
- GPT-6 Astra:資料制約が-19点の急落
- GPT-6.1 Sol:資料制約が-19点の急落
- GPT-6 Sol:資料制約が-21.2点の急落
- Gemini 2.5 Pro:資料制約が-16点の急落
- Claude Opus 4.7:メインランキングが-21点の急落
- GLM-4.6:メインランキングが-13.6点の急落
- Qwen3 Max:データ不完全(コード実行・資料制約・判定・誠実性・対話の各次元が欠損、API障害/タイムアウト)。自動補完実行中のため、今回は順位に参加しない
このようなSmokeレポートを読む際は、2つの点に注目すべきである。第一に、あるモデルが複数日にわたって同じ種類の弱点を示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行していないかどうか。単日のコード実行または資料制約スコアの大幅な変動は、問題のサンプリングに起因する場合もあれば、実際の性能劣化の早期シグナルである場合もあり、後続の実行による再確認が必要である。
データ出典:YZ Index | Run #373 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接