2026-10-03 のYZ Index Smoke速測は15モデルを対象とし、Claude Opus 4.7が98.65点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適しているが、Full週間ランキングの結論とは同一視できない。
今回のSmoke評価はコード実行と資料制約の2つのメイン指標のみを対象としており、メインスコアの計算式は 0.55 × コード実行 + 0.45 × 資料制約 である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な結論ではなく、モニタリングシグナルとして参照するのが適切である。
当日ランキング
| 順位 | モデル | メイン | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 98.65 | 100 | 97 | pass |
| #2 | GPT-o3 | 92.71 | 100 | 83.8 | pass |
| #3 | Gemini 2.5 Pro | 87.4 | 100 | 72 | pass |
| #4 | Gemini 3.1 Pro | 87.4 | 100 | 72 | pass |
| #5 | GPT-6 Sol | 85.26 | 75 | 97.8 | pass |
| #6 | Grok 4 | 84.9 | 75 | 97 | pass |
| #7 | DeepSeek V4 Pro | 83.91 | 75 | 94.8 | pass |
| #8 | Claude Sonnet 4.6 | 79.65 | 73.8 | 86.8 | pass |
| #9 | GPT-6.1 Sol | 77.07 | 58.3 | 100 | pass |
| #10 | GPT-6 Astra | 74.73 | 58.3 | 94.8 | pass |
| #11 | Doubao Pro | 72.28 | 83.3 | 58.8 | pass |
| #12 | GPT-5.5 | 68.74 | 58.3 | 81.5 | pass |
| #13 | GPT-6 Luna | 68.74 | 58.3 | 81.5 | pass |
| #14 | Qwen3 Max | 66.45 | 75 | 56 | pass |
| #15 | GLM-4.6 | 38.75 | 50 | 25 | warn |
データ解説
本日のYZ Index Smoke速測において、Claude Opus 4.7はメインスコア98.65で首位となり、コード実行100・資料制約97という組み合わせが両指標ともにバランスよく高水準であることを示している。GPT-o3はメインスコア92.71で、コード実行も同様に100だが資料制約は83.8となっており、コード実行主導の構造を反映している。Gemini 2.5 ProとGemini 3.1 Proはともにメインスコア87.4で、コード実行100・資料制約72という組み合わせがコード実行の優位性を示している。GPT-6 Solはメインスコア85.26で、コード実行75・資料制約97.8と資料制約がより強い補完的な特徴を持ち、Grok 4とDeepSeek V4 Proもコード実行75・資料制約97および94.8という類似した構成を維持している。
Gemini 3.1 Proのメインスコアは前回同条件のrunと比較して29.8上昇し、コード実行は56.6上昇しており、コード実行面での顕著な改善が見られる。GPT-o3はメインスコアが20.3上昇し、コード実行が29.7、資料制約が8.8それぞれ上昇した。DeepSeek V4 Proのメインスコアは16上昇し、コード実行は33.3上昇した。一方、GLM-4.6のメインスコアは29.2下落し、資料制約は75下落、誠実性評価はfailからwarnに変化した。GPT-5.5のメインスコアは17.5下落し、コード実行が16.7、資料制約が18.5それぞれ下落した。
異常シグナルとして、Gemini 2.5 Proの資料制約が28の急落、GPT-6.1 Solのメインスコアが9.2の急落、GPT-6 Astraのメインスコアが11.5の急落、Doubao Proのメインスコアが9.3の急落、GPT-5.5のメインスコアが17.5の急落、GPT-6 Lunaのメインスコアが10.8の急落、GLM-4.6のメインスコアが29.2の急落が確認されており、いずれも問題サンプリングのばらつきまたは実際の性能低下が原因である可能性があり、後続runでの確認が必要である。Smokeは小サンプルの単日シグナルであるため、上記の観察は当日のデータ構造上の特徴を反映したものに過ぎない。
主な変動
- Gemini 3.1 Pro:メインスコア+29.8点、コード実行+56.6点
- GLM-4.6:メインスコア-29.2点、コード実行+8.3点、資料制約-75点、誠実性 fail→warn
- GPT-o3:メインスコア+20.3点、コード実行+29.7点、資料制約+8.8点
- GPT-5.5:メインスコア-17.5点、コード実行-16.7点、資料制約-18.5点
- DeepSeek V4 Pro:メインスコア+16点、コード実行+33.3点、資料制約-5.2点
注目すべきシグナル
- Gemini 2.5 Pro:資料制約が急落 -28点
- GPT-6.1 Sol:メインスコアが急落 -9.2点
- GPT-6 Astra:メインスコアが急落 -11.5点
- Doubao Pro:メインスコアが急落 -9.3点
- GPT-5.5:メインスコアが急落 -17.5点
- GPT-6 Luna:メインスコアが急落 -10.8点
- GLM-4.6:メインスコアが急落 -29.2点
このようなSmoke速報を読む際には、二つの点に重点を置くべきである。第一に、あるモデルが複数日にわたって同種の弱点を示していないか。第二に、誠実性評価がpassからwarnまたはfailに変化していないか。単日のコード実行または資料制約スコアの大幅な変動は、問題サンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである場合もあり、後続runでの確認が必要である。
データ出典:YZ Index | Run #358 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接