2026-10-06 のYZ Index Smokeクイックテストは15モデルを対象とし、GPT-6 Luna と GPT-6 Sol が80.99点で当日首位に並んだ。Smoke は毎日10問のクイックテストであり、短期シグナルの観測に適しているが、Fullウィークリーランキングの結論とは同等ではない。
今回のSmokeテストはコード実行と資料制約の2つの主ランキング軸のみを対象とし、主ランキングの計算式は 0.55 × コード実行 + 0.45 × 資料制約 である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価としてではなく、モニタリングシグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | 主ランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | GPT-6 Luna | 80.99 | 75 | 88.3 | pass |
| #2 | GPT-6 Sol | 80.99 | 75 | 88.3 | pass |
| #3 | GPT-5.5 | 78.02 | 75 | 81.7 | pass |
| #4 | GPT-o3 | 78.02 | 75 | 81.7 | pass |
| #5 | Grok 4 | 77.3 | 73.7 | 81.7 | warn |
| #6 | Doubao Pro | 71.99 | 75 | 68.3 | pass |
| #7 | Claude Sonnet 4.6 | 69.49 | 50 | 93.3 | pass |
| #8 | Claude Opus 4.7 | 67.24 | 50 | 88.3 | pass |
| #9 | GPT-6 Astra | 67.24 | 50 | 88.3 | pass |
| #10 | Qwen3 Max | 65.04 | 46 | 88.3 | pass |
| #11 | GPT-6.1 Sol | 55.99 | 50 | 63.3 | pass |
| #12 | DeepSeek V4 Pro | 51.42 | 41.7 | 63.3 | pass |
| #13 | Gemini 2.5 Pro | 51.42 | 41.7 | 63.3 | pass |
| #14 | Gemini 3.1 Pro | 51.42 | 41.7 | 63.3 | pass |
| #15 | GLM-4.6 | 9 | 0 | 20 | pass |
データ解釈
当日の主ランキング上位2位はGPT-6 LunaとGPT-6 Solでともに80.99点を獲得し、コード実行75・資料制約88.3という結果は、両者が2項目の能力においてバランスのとれた構成を示している。GPT-5.5とGPT-o3も同様にコード実行75・資料制約81.7で78.02点を獲得し、3位・4位に入った。Grok 4はコード実行73.7・資料制約81.7、主ランキング77.3点で5位。Claude Sonnet 4.6はコード実行50・資料制約93.3、主ランキング69.49点となり、資料制約が相対的に突出した構造的特徴を示した。
前回同条件の実施と比較すると、Gemini 2.5 Proは主ランキング37.2点低下・コード実行49.6点低下・資料制約22点低下、GLM-4.6は主ランキング32.7点低下・コード実行44.5点低下・資料制約18.3点低下、DeepSeek V4 Proは主ランキング31.7点低下・コード実行49.6点低下・資料制約9.8点低下、Claude Opus 4.7は主ランキング28.4点低下・コード実行44.5点低下・資料制約8.7点低下、Gemini 3.1 Proは主ランキング25.2点低下・コード実行27.8点低下・資料制約22点低下となった。これらの変動は問題サンプリングのばらつきによる可能性もあれば、モデルの実際のパフォーマンス低下を示している可能性もあり、後続の実施で確認する必要がある。
Smokeクイックテストは小規模サンプルによる単日シグナルであり、上記のスコア構造と変動はあくまで当日のデータを反映したものであり、長期的な判断は行わない。
主な変化
- Gemini 2.5 Pro:主ランキング37.2点低下、コード実行-49.6点、資料制約-22点
- GLM-4.6:主ランキング32.7点低下、コード実行-44.5点、資料制約-18.3点
- DeepSeek V4 Pro:主ランキング31.7点低下、コード実行-49.6点、資料制約-9.8点
- Claude Opus 4.7:主ランキング28.4点低下、コード実行-44.5点、資料制約-8.7点
- Gemini 3.1 Pro:主ランキング25.2点低下、コード実行-27.8点、資料制約-22点
注目すべきシグナル
- 今回、公開対象となる異常シグナルは検出されなかった。
この種のSmoke速報を読む際は、2点に重点を置くべきである。第一に、あるモデルが複数日連続して同種の弱点を露呈していないか。第二に、誠実性評価がpassからwarnまたはfailに変化していないか。単日のコード実行または資料制約スコアの大幅な変動は、問題サンプリングによるものである場合もあれば、実際のパフォーマンス低下の初期シグナルである場合もあり、後続の実施で検証する必要がある。
データ出典:YZ Index | Run #363 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接