2026-09-23 YZ Index Smoke クイックテストは10モデルを対象とし、Claude Sonnet 4.6が96.98点で当日首位を獲得した。Smokeは毎日10問のクイックテストであり、短期シグナルの観察に適しているが、Full週次ランキングの結論と同等ではない。
今回のSmokeテストはコード実行と資料制約の2つのメインランキング指標のみを対象としており、メインランキングの計算式は 0.55 × コード実行 + 0.45 × 資料制約 である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価ではなく、モニタリングシグナルとして参照するのが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Sonnet 4.6 | 96.98 | 94.5 | 100 | pass |
| #2 | Claude Opus 4.7 | 96.76 | 94.1 | 100 | pass |
| #3 | Gemini 2.5 Pro | 95.19 | 93.7 | 97 | pass |
| #4 | GPT-5.5 | 91.89 | 89.5 | 94.8 | pass |
| #5 | Qwen3 Max | 91.26 | 85.9 | 97.8 | pass |
| #6 | Grok 4 | 80.89 | 69.5 | 94.8 | pass |
| #7 | GPT-o3 | 80.48 | 64.5 | 100 | pass |
| #8 | Gemini 3.1 Pro | 79.13 | 64.5 | 97 | pass |
| #9 | DeepSeek V4 Pro | 78.14 | 64.5 | 94.8 | pass |
| #10 | Doubao Pro | 73.5 | 64.5 | 84.5 | pass |
データの解説
本日のYZ Index Smokeクイックテストでは、上位モデルがコード実行と資料制約の両指標において均衡した高水準を示した。Claude Sonnet 4.6はメインランキング96.98点で首位となり、コード実行94.5・資料制約100を記録。Claude Opus 4.7はメインランキング96.76点、コード実行94.1・資料制約100。Gemini 2.5 Proはメインランキング95.19点、コード実行93.7・資料制約97。この3モデルはいずれも誠実性がpassを維持し、資料制約は軒並み100に近いか100に達しており、コード実行は93.7から94.5の範囲にあり、強弱が補完し合う構造的優位性を形成している。
複数のモデルで顕著な変動が見られた。Gemini 2.5 Proはメインランキング+22.7点、コード実行+21.7点・資料制約+23.9点。Qwen3 Maxはメインランキング+12.8点、コード実行+13.9点・資料制約+11.5点。DeepSeek V4 Proはメインランキング+12.1点、コード実行-7.5点・資料制約+36.1点。Doubao Proはメインランキング-17.3点、コード実行-31.8点。GPT-o3はメインランキング-15.5点、コード実行-32.5点・資料制約+5.2点。これらの変動は単日10問という少サンプルの抽様に起因しており、スコアの変動が真の性能低下であるかを区別するには、追加の検証が必要である。
異常シグナルは複数のモデルに集中している。Grok 4はメインランキングが-10点と急落し、GPT-o3は-15.5点の急落、Gemini 3.1 Proはコード実行が-31.8点の急落、Doubao Proはメインランキングが-17.3点の急落を記録した。GLM-4.6はAPIの障害によりデータが不完全で、今回のランキングには参加していない。以上はいずれもSmoke単日のシグナルであり、変動幅は問題の抽様による影響を受けている可能性があるため、複数回のテストで安定性を確認する必要がある。
主な変動
- Gemini 2.5 Pro:メインランキング+22.7点、コード実行+21.7点、資料制約+23.9点
- Doubao Pro:メインランキング-17.3点、コード実行-31.8点
- GPT-o3:メインランキング-15.5点、コード実行-32.5点、資料制約+5.2点
- Qwen3 Max:メインランキング+12.8点、コード実行+13.9点、資料制約+11.5点
- DeepSeek V4 Pro:メインランキング+12.1点、コード実行-7.5点、資料制約+36.1点
注目すべきシグナル
- Grok 4:メインランキング急落 -10点
- GPT-o3:メインランキング急落 -15.5点
- Gemini 3.1 Pro:コード実行急落 -31.8点
- Doubao Pro:メインランキング急落 -17.3点
- GLM-4.6:データ不完全(API障害・タイムアウトにより複数指標が欠損)のため自動再実行中、今回はランキングに参加せず
このようなSmokeブリーフィングを読む際は、2つの点に着目することが重要である。第1に、あるモデルが複数日にわたって同種の弱点を示していないか。第2に、誠実性評価がpassからwarnまたはfailに変化していないか。単日のコード実行や資料制約スコアの大幅な変動は、問題の抽様によるものである場合もあれば、真の性能低下の初期シグナルである可能性もあり、追加の検証が必要である。
データ出典:YZ Index | Run #335 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接