2026年9月3日のYZ Index Smoke速測では11モデルをカバーし、GPT-o3が83.94点で当日首位を獲得した。Smokeは1日10問の速測であり、短期シグナルの観察に適しており、Fullウィークリーランキングの結論とは同一ではない。
今回のSmoke評価はコード実行と資料制約の2つのメインランキング指標のみをカバーしており、メインランキングの算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価としてではなく、モニタリングシグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | メイン | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | GPT-o3 | 83.94 | 100 | 64.3 | pass |
| #2 | Doubao Pro | 79.12 | 100 | 53.6 | pass |
| #3 | GPT-5.5 | 79.12 | 100 | 53.6 | pass |
| #4 | Claude Sonnet 4.6 | 66.09 | 75 | 55.2 | pass |
| #5 | Gemini 3.1 Pro | 65.84 | 83.3 | 44.5 | pass |
| #6 | Grok 4 | 62 | 75 | 46.1 | pass |
| #7 | Claude Opus 4.7 | 58.94 | 75 | 39.3 | pass |
| #8 | Qwen3 Max | 56.09 | 60 | 51.3 | pass |
| #9 | GLM-4.6 | 48.25 | 50 | 46.1 | fail |
| #10 | Gemini 2.5 Pro | 47.53 | 50 | 44.5 | pass |
| #11 | DeepSeek V4 Pro | 45.19 | 50 | 39.3 | pass |
データ解説
本日のYZ Index Smoke速測において、上位モデルはコード実行と資料制約の組み合わせにおいて明確な差異を示した。GPT-o3はコード実行100・資料制約64.3でメインスコア83.94を獲得し、Doubao ProとGPT-5.5はともにコード実行100・資料制約53.6でメインスコア79.12と並んだ。Claude Sonnet 4.6はコード実行75・資料制約55.2でメイン66.09、Gemini 3.1 Proはコード実行83.3・資料制約44.5でメイン65.84となった。これらのモデルのうち、コード実行満点の組み合わせがメインランキング算式(0.55×コード実行+0.45×資料制約)において上位を占め、資料制約スコアが相対的に低いモデルはコード実行によって全体スコアを引き上げる構造となっている。
複数のモデルで前回同条件の実行と比較して顕著な下落が見られた。Gemini 2.5 Proはメイン40.9点下落、コード実行50点下落、資料制約29.7点下落。Grok 4はメイン26.4点下落、コード実行25点下落、資料制約28.1点下落。Claude Sonnet 4.6はメイン22.3点下落、コード実行25点下落、資料制約19点下落。DeepSeek V4 ProとGemini 3.1 Proもそれぞれメインで22.3点と21.8点の下落を示し、コード実行・資料制約の両項目で後退した。
今回のSmoke速測は小サンプルの単日シグナルであり、上記の変化は問題のサンプリング変動に起因する可能性もあれば、真の性能低下である可能性もあるため、後続の実行による検証で安定性を確認する必要がある。誠実性がfailとなったGLM-4.6のメインスコアは48.25であり、コード実行50・資料制約46.1という構造はランキング中位に位置し、全体の順位付けに追加的な影響は与えていない。
主な変動
- Gemini 2.5 Pro:メイン40.9点下落、コード実行-50点、資料制約-29.7点
- Grok 4:メイン26.4点下落、コード実行-25点、資料制約-28.1点
- Claude Sonnet 4.6:メイン22.3点下落、コード実行-25点、資料制約-19点
- DeepSeek V4 Pro:メイン22.3点下落、コード実行-25点、資料制約-19点
- Gemini 3.1 Pro:メイン21.8点下落、コード実行-16.7点、資料制約-28.1点
注目すべきシグナル
- GLM-4.6:本日の誠実性評価はfail(当日Smokeデータに基づく)。
このようなSmoke速報を読む際には、2点に着目すべきである。第一に、特定のモデルが複数日にわたって同種の弱点を露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行・資料制約スコアの大幅な変動は、問題のサンプリングに起因する場合もあれば、真の性能低下の初期シグナルである可能性もあり、後続の実行による検証が必要である。
データ出典:YZ Index | Run #307 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接