2026-10-02 YZ Index Smoke速報テストは15モデルをカバーし、Claude Opus 4.7・GPT-5.5・GPT-6 Astra・GPT-6.1 Solが86.25点で当日首位に並んだ。Smokeは1日10問の速報テストであり、短期シグナルの観察に適しているが、Fullウィークリーランキングの結論とは同一視できない。
今回のSmoke評価はコード実行とマテリアル制約の2つのメインランキング指標のみを対象としており、メインランキングの計算式は0.55 × コード実行 + 0.45 × マテリアル制約である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な評価よりも、モニタリングシグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | マテリアル制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 86.25 | 75 | 100 | pass |
| #2 | GPT-5.5 | 86.25 | 75 | 100 | pass |
| #3 | GPT-6 Astra | 86.25 | 75 | 100 | pass |
| #4 | GPT-6.1 Sol | 86.25 | 75 | 100 | pass |
| #5 | Gemini 2.5 Pro | 84.55 | 71.9 | 100 | pass |
| #6 | GPT-6 Sol | 84 | 75 | 95 | pass |
| #7 | Grok 4 | 83.67 | 70.3 | 100 | pass |
| #8 | Claude Sonnet 4.6 | 81.75 | 75 | 90 | pass |
| #9 | Doubao Pro | 81.6 | 87 | 75 | pass |
| #10 | GPT-6 Luna | 79.5 | 75 | 85 | warn |
| #11 | GPT-o3 | 72.42 | 70.3 | 75 | pass |
| #12 | Qwen3 Max | 71.05 | 71.9 | 70 | pass |
| #13 | DeepSeek V4 Pro | 67.94 | 41.7 | 100 | pass |
| #14 | GLM-4.6 | 67.94 | 41.7 | 100 | fail |
| #15 | Gemini 3.1 Pro | 57.62 | 43.4 | 75 | pass |
データ解説
本日のメインランキング上位4モデルであるClaude Opus 4.7・GPT-5.5・GPT-6 Astra・GPT-6.1 Solは、いずれもコード実行75・マテリアル制約100という同一構成を示し、メインランキングスコアも同じく86.25となった。この組み合わせは、マテリアル制約の満点が全体順位を支える効果を示しており、コード実行は75の水準に留まっている。Gemini 2.5 Proはコード実行71.9・マテリアル制約100でメインランキング84.55を記録し、マテリアル制約の満点獲得により高順位を維持できることが示された。Doubao Proはコード実行87・マテリアル制約75でメインランキング81.6となり、コード実行の優位性とマテリアル制約の弱点が相互補完の関係にある。
前回同条件の実行と比較すると、Gemini 3.1 Proはメインランキングが23.6点低下・コード実行が26.6点低下・マテリアル制約が20点低下、GLM-4.6はメインランキングが16.1点低下・コード実行が33.3点低下し、誠実性評価がpassからfailに転落した。GPT-5.5はメインランキングが16点上昇・コード実行が25点上昇した。Doubao Proはメインランキングが13.9点低下・マテリアル制約が22点低下、DeepSeek V4 Proはメインランキングが13.3点低下・コード実行が28.3点低下した。これらの変動は問題のサンプリングによるばらつきに起因する可能性もあれば、単日の実際のパフォーマンス差を反映している可能性もあり、後続の実行による確認が必要である。
Smokeテストは小サンプルの単日シグナルであり、現在のデータはトップモデルがコード実行とマテリアル制約の特定の組み合わせにおいてメインランキング86.25を達成したことを示すにすぎない。一部モデルで顕著なスコアの変動が見られるが、解釈は慎重に行い、長期的なトレンドへの推断は避けるべきである。
主な変化
- Gemini 3.1 Pro:メインランキング-23.6点、コード実行-26.6点、マテリアル制約-20点
- GLM-4.6:メインランキング-16.1点、コード実行-33.3点、マテリアル制約+5点、誠実性 pass→fail
- GPT-5.5:メインランキング+16点、コード実行+25点、マテリアル制約+5点
- Doubao Pro:メインランキング-13.9点、コード実行-7.3点、マテリアル制約-22点
- DeepSeek V4 Pro:メインランキング-13.3点、コード実行-28.3点、マテリアル制約+5点
注目すべきシグナル
- GLM-4.6:本日の誠実性評価はfail(当日のSmokeデータに基づく)。
このようなSmoke速報を読む際は、2つの問いに重点を置くべきである。第1に、あるモデルが複数日にわたって同種の弱点を露呈し続けているか否か。第2に、誠実性評価がpassからwarnまたはfailに移行していないか否か。単日のコード実行または制約スコアの大幅な変化は、問題のサンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである可能性もあり、後続の実行による確認が必要である。
データ出典:YZ Index | Run #356 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接