2026-09-16 のYZ Index Smoke速測は10モデルを対象とし、Claude Sonnet 4.6が100点で当日首位となった。Smokeは1日10問の速測であり、短期シグナルの観察に適しているが、Fullウィークリーランキングの結論とは同等ではない。
今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な判断ではなく、モニタリングシグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | メインスコア | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Sonnet 4.6 | 100 | 100 | 100 | pass |
| #2 | Doubao Pro | 84.55 | 71.9 | 100 | pass |
| #3 | Claude Opus 4.7 | 84 | 75 | 95 | pass |
| #4 | GPT-5.5 | 84 | 75 | 95 | pass |
| #5 | Grok 4 | 81.42 | 70.3 | 95 | pass |
| #6 | Qwen3 Max | 80.59 | 68.8 | 95 | pass |
| #7 | GPT-o3 | 70.64 | 70.5 | 70.8 | pass |
| #8 | Gemini 3.1 Pro | 70.25 | 50 | 95 | pass |
| #9 | DeepSeek V4 Pro | 67.39 | 44.8 | 95 | pass |
| #10 | Gemini 2.5 Pro | 63.42 | 47.8 | 82.5 | pass |
データ解説
今回のYZ Index Smoke速測において、Claude Sonnet 4.6はコード実行100・資料制約100を背景にメインスコア100を獲得し、コード実行と資料制約の均衡した高水準の組み合わせを示した。Doubao Proはコード実行71.9・資料制約100でメインスコア84.55となり、資料制約が全体ランキングを大きく押し上げていることが分かる。Claude Opus 4.7とGPT-5.5はともにメインスコア84で、コード実行75・資料制約95という同一の構成を示しており、両者のコード実行と資料制約のバランスが近似していることが分かる。Grok 4はコード実行70.3・資料制約95でメインスコア81.42、Qwen3 Maxはコード実行68.8・資料制約95でメインスコア80.59であり、上位グループでは資料制約が概ね95以上を維持している。
Gemini 2.5 Proのメインスコアは63.42となり、同条件の前回比で36.6点下落した。うちコード実行は47.8(前回比-52.2点)、資料制約は82.5(前回比-17.5点)であった。Claude Sonnet 4.6の資料制約は前回比50点上昇し、メインスコアは22.5点上昇した。GPT-o3はコード実行70.5・資料制約70.8でメインスコア70.64となり、前回比18.1点下落し、コード実行は29.5点下落した。Qwen3 Maxの資料制約は前回比55.7点上昇、メインスコアは7.9点上昇した一方、コード実行は31.2点下落した。Grok 4はコード実行が29.7点下落・資料制約が20点上昇し、メインスコアは7.3点下落した。
以上のスコア変動は、単日の問題サンプリングのばらつきに起因する可能性もあれば、特定次元における実際のパフォーマンス差を反映している可能性もあり、今後の同条件での再実行による確認が必要である。Smoke速測は小サンプルの単日シグナルであり、現在のデータは当日の観察目的に限定されるものであり、長期トレンド判断の根拠とはならない。
主な変化
- Gemini 2.5 Pro:メインスコア-36.6点、コード実行-52.2点、資料制約-17.5点
- Claude Sonnet 4.6:メインスコア+22.5点、資料制約+50点
- GPT-o3:メインスコア-18.1点、コード実行-29.5点
- Qwen3 Max:メインスコア+7.9点、コード実行-31.2点、資料制約+55.7点
- Grok 4:メインスコア-7.3点、コード実行-29.7点、資料制約+20点
注目すべきシグナル
- 今回、公表すべき異常シグナルは確認されなかった。
このようなSmoke簡報を読む際は、2点に注目すべきである。第一に、あるモデルが複数日連続して同種の弱点を露呈していないか。第二に、誠実性評価がpassからwarnまたはfailに移行していないか。単日のコード実行や資料制約スコアの大幅な変動は、問題サンプリングに起因する場合もあれば、実際の性能低下の早期シグナルである場合もあり、後続の再実行による確認が必要である。
データ出典:YZ Index | Run #325 | 元データを確認
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接