2026-10-11 のYZ Index Smoke速報は13モデルを対象とし、Claude Opus 4.7・GPT-6 Astra・GPT-6.1 Sol が79.79点で当日首位に並んだ。Smokeは1日10問の速報テストであり、短期シグナルの観察に適しており、Full週次ランキングの結論とは同一視できない。
今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみをカバーし、メインランキングの算式は 0.55 × コード実行 + 0.45 × 資料制約 である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な判断よりも、モニタリングシグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | メイン | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 79.79 | 72 | 89.3 | pass |
| #2 | GPT-6 Astra | 79.79 | 72 | 89.3 | pass |
| #3 | GPT-6.1 Sol | 79.79 | 72 | 89.3 | pass |
| #4 | Claude Sonnet 4.6 | 74.52 | 72 | 77.6 | pass |
| #5 | Gemini 3.1 Pro | 68.54 | 72 | 64.3 | pass |
| #6 | Gemini 2.5 Pro | 66.04 | 47 | 89.3 | pass |
| #7 | GPT-6 Sol | 66.04 | 47 | 89.3 | pass |
| #8 | Grok 4 | 64.92 | 75 | 52.6 | pass |
| #9 | GPT-6 Luna | 62.1 | 72 | 50 | pass |
| #10 | Doubao Pro | 54.79 | 47 | 64.3 | pass |
| #11 | GPT-o3 | 54.79 | 47 | 64.3 | pass |
| #12 | DeepSeek V4 Pro | 49.52 | 47 | 52.6 | pass |
| #13 | GPT-5.5 | 48.35 | 47 | 50 | pass |
データ解説
当日のメインランキング上位3モデル、Claude Opus 4.7・GPT-6 Astra・GPT-6.1 Sol はいずれも79.79点を記録し、コード実行72点・資料制約89.3点と構成が完全に一致しており、資料制約次元で高水準を維持しながらコード実行も同一区間にあることを示している。4位のClaude Sonnet 4.6は74.52点で続き、コード実行は同じく72点だが資料制約は77.6点に低下しており、資料制約の相対的な弱化が総合順位に与える影響を反映している。Gemini 3.1 Proはコード実行72点・資料制約64.3点でメイン68.54点、Grok 4はコード実行75点・資料制約52.6点で64.92点を記録し、コード実行と資料制約の強弱の組み合わせが異なるモデルの当日スコア分布が示されている。
DeepSeek V4 Proはメインランキングで47.4点下落し、コード実行-53点・資料制約-40.6点;GPT-5.5はメインで38.6点下落し、コード実行-53点・資料制約-20.9点;GPT-o3はメインで35点下落し、コード実行-51.5点・資料制約-14.8点;Doubao Proはメインで32.1点下落し、コード実行-53点・資料制約-6.6点;GPT-6 Lunaはメインで26.7点下落し、コード実行-28点・資料制約-25点となった。これらの顕著な変化は、単日の問題サンプリングの変動によるものの可能性もあれば、モデルの実際のパフォーマンス低下を反映している可能性もあり、同一条件での追加実行による再確認が必要である。Smoke速報は小サンプルの単日シグナルであり、以上の観察は当日の参考情報にとどまり、長期的な判断の根拠とはならない。
主な変化
- DeepSeek V4 Pro:メインランキング47.4点下落、コード実行-53点、資料制約-40.6点
- GPT-5.5:メインランキング38.6点下落、コード実行-53点、資料制約-20.9点
- GPT-o3:メインランキング35点下落、コード実行-51.5点、資料制約-14.8点
- Doubao Pro:メインランキング32.1点下落、コード実行-53点、資料制約-6.6点
- GPT-6 Luna:メインランキング26.7点下落、コード実行-28点、資料制約-25点
注目すべきシグナル
- 今回は公表可能な異常シグナルは確認されなかった。
この種のSmoke速報を読む際は、2点に着目すべきである。第一に、特定のモデルが複数日にわたって同種の弱点を繰り返し露呈していないか。第二に、誠実性評価がpassからwarnまたはfailに移行していないか。単日のコード実行または資料制約スコアの大幅な変動は、問題サンプリングに起因する可能性もあれば、実際のパフォーマンス低下の早期シグナルである可能性もあり、追加実行での再確認が必要である。
データ出典:YZ Index | Run #371 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接