2026-09-18のYZ Index Smoke速報は10モデルを対象に実施され、Claude Opus 4.7が100点を獲得し当日首位となった。Smokeは毎日10問の速報テストであり、短期的なシグナルを観察するのに適しているが、Full週次ランキングの結論とは同一ではない。
今回のSmokeテストはコード実行と資料制約の2つの主要次元のみをカバーしており、主榜スコアの計算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価ではなく、監視シグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | 主榜 | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 100 | 100 | 100 | pass |
| #2 | GPT-o3 | 99.01 | 100 | 97.8 | pass |
| #3 | Claude Sonnet 4.6 | 94.34 | 99.6 | 87.9 | pass |
| #4 | GPT-5.5 | 92.26 | 95 | 88.9 | pass |
| #5 | Gemini 2.5 Pro | 90.91 | 100 | 79.8 | pass |
| #6 | Doubao Pro | 83.5 | 70 | 100 | warn |
| #7 | Qwen3 Max | 82.42 | 89.3 | 74 | pass |
| #8 | Grok 4 | 81.17 | 75 | 88.7 | pass |
| #9 | Gemini 3.1 Pro | 69.75 | 45 | 100 | pass |
| #10 | DeepSeek V4 Pro | 67.51 | 50 | 88.9 | pass |
データ分析
本日のYZ Index Smoke速報において、Claude Opus 4.7は主榜100・コード実行100・資料制約100という構成で首位に立ち、コード実行と資料制約が完全な均衡を形成している。GPT-o3の主榜は99.01で、コード実行100・資料制約97.8となっており、コード実行は満点を維持しつつ資料制約がわずかに低い結果となった。Claude Sonnet 4.6の主榜は94.34で、コード実行99.6・資料制約87.9と、同様にコード実行が資料制約を上回る構成となっている。Gemini 2.5 Proは主榜90.91で、コード実行100・資料制約79.8と、コード実行が高く資料制約が低い特徴がさらに顕著に現れている。一方、Doubao Proは主榜83.5で、コード実行70・資料制約100と、資料制約が満点でコード実行が弱いという対照的な構成を示している。
顕著な変動として、Claude Opus 4.7の主榜は前回同条件の実行と比較して33.2点上昇し、うちコード実行が53点上昇、資料制約が9.1点上昇した。Qwen3 Maxの主榜は27.8点上昇し、コード実行が64.3点上昇した一方で資料制約は16.9点下落した。GPT-o3の主榜は21.6点上昇し、コード実行が28点・資料制約が13.7点それぞれ上昇した。これらの上昇はコード実行次元による牽引が主因であり、資料制約では結果が分かれる形となった。Qwen3 Maxの資料制約が16.9点急落したことについては、単日の問題サンプリングによる変動の可能性もあるが、実際の性能低下という可能性も排除できず、シグナルの安定性を確認するため後続の実行による再検証が必要である。GLM-4.6はAPI障害によりデータが不完全となったため、今回はランキングに参加しなかった。
全体として、上位モデルはコード実行と資料制約の強弱の組み合わせにそれぞれの特色が見られ、変動が目立つモデルのスコア変化はコード実行次元に集中しており、資料制約側の変動は比較的限定的だった。Smokeは小サンプルの単日シグナルであるため、上記の観察は当日データの特徴を反映するものに過ぎず、長期的な判断の根拠とはならない。
主な変動
- Claude Opus 4.7:主榜+33.2点、コード実行+53点、資料制約+9.1点
- Qwen3 Max:主榜+27.8点、コード実行+64.3点、資料制約-16.9点
- GPT-o3:主榜+21.6点、コード実行+28点、資料制約+13.7点
- DeepSeek V4 Pro:主榜+19.7点、資料制約+43.7点
- Claude Sonnet 4.6:主榜+17.9点、コード実行+27.6点、資料制約+6.1点
注目すべきシグナル
- Qwen3 Max:資料制約が-16.9点の急落
- GLM-4.6:データ不完全(API障害・タイムアウトにより複数次元のデータが欠損)のため自動再実行に移行中、今回のランキングには参加せず
このようなSmoke速報を読む際には、二つの点に重点を置くべきである。第一に、あるモデルが複数日にわたって同種の弱点を露呈していないか。第二に、誠実性評価がpassからwarnまたはfailに転じていないか。単日のコード実行や資料制約スコアの大幅な変動は、問題サンプリングに起因する場合もあれば、実際の性能低下の早期シグナルである場合もあり、後続の実行による再検証が必要である。
データ出典:YZ Index | Run #328 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接