2026-09-14のYZ Index Smoke速測は10モデルを対象とし、Claude Opus 4.7、DeepSeek V4 Pro、Doubao Pro、GPT-5.5が91.09点で当日首位に並んだ。Smokeは毎日10問の速測であり、短期シグナルの観察に適しているが、週次Fullランキングの結論とは同一視できない。
今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力に対する長期的な結論としてではなく、モニタリングシグナルとして扱うことが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 91.09 | 100 | 80.2 | pass |
| #2 | DeepSeek V4 Pro | 91.09 | 100 | 80.2 | pass |
| #3 | Doubao Pro | 91.09 | 100 | 80.2 | pass |
| #4 | GPT-5.5 | 91.09 | 100 | 80.2 | pass |
| #5 | Gemini 3.1 Pro | 87 | 100 | 71.1 | pass |
| #6 | Grok 4 | 86.61 | 99.3 | 71.1 | pass |
| #7 | Claude Sonnet 4.6 | 82.5 | 100 | 61.1 | pass |
| #8 | Qwen3 Max | 70.47 | 62.5 | 80.2 | warn |
| #9 | Gemini 2.5 Pro | 70.19 | 75 | 64.3 | pass |
| #10 | GPT-o3 | 70.19 | 75 | 64.3 | pass |
データ解説
本日のメインランキング上位4モデルであるClaude Opus 4.7、DeepSeek V4 Pro、Doubao Pro、GPT-5.5はいずれもコード実行100・資料制約80.2という構成を示し、メインランキングスコアも同じく91.09となっており、両次元の強弱バランスが均等で数値が一致していることが確認できる。Gemini 3.1 Proはコード実行が同じく100であるが資料制約が71.1に低下し、メインランキングは87に後退した。Grok 4はコード実行99.3・資料制約71.1でメインランキング86.61、Claude Sonnet 4.6はコード実行100・資料制約61.1でメインランキング82.5となっており、資料制約のスコア差が全体的な順位に与える影響が示されている。
GPT-5.5のメインランキングは前回同条件の実施と比較して30.2点上昇し、うちコード実行が25点、資料制約が36.6点上昇した。Claude Sonnet 4.6はメインランキングが28.9点上昇・コード実行が50点上昇、Claude Opus 4.7はメインランキングが27.5点上昇・コード実行が50点上昇、DeepSeek V4 ProはメインランキングがI3.8点上昇・コード実行が25点上昇、GPT-o3はメインランキングが15点下降・コード実行が25点下降した。以上の変動はすべて単日Smokeの小サンプルデータに基づくものであり、問題抽出による変動なのか実際の性能低下なのかを区別するため、後続の実施による検証が必要である。
GPT-o3のメインランキングに-15点という異常シグナルが現れており、単日サンプリングの変動またはモデルパフォーマンスの一時的な変化が原因として考えられるため、完全な実施による検証が必要である。GLM-4.6については、コード実行・資料参照・判定・誠実性・コミュニケーションの各次元のデータが欠如していることからランキングに参加しておらず、APIの障害またはタイムアウトにより自動再実行が発動済みであるため、本期の結果は当日限りの参考として扱うこと。
主な変動
- GPT-5.5:メインランキング+30.2点、コード実行+25点、資料制約+36.6点
- Claude Sonnet 4.6:メインランキング+28.9点、コード実行+50点
- Claude Opus 4.7:メインランキング+27.5点、コード実行+50点
- GPT-o3:メインランキング-15点、コード実行-25点
- DeepSeek V4 Pro:メインランキング+13.8点、コード実行+25点
注目すべきシグナル
- GPT-o3:メインランキングが急落、-15点
- GLM-4.6:データ不完全(コード実行・資料参照・判定・誠実性・コミュニケーションの各次元が欠如、APIの障害/タイムアウト)、自動再実行中につき本期はランキング対象外
このようなSmoke速報を読む際には、2つの点に重点を置くべきである。第1に、特定のモデルが同じ種類の弱点を複数日連続して露呈しているかどうか、第2に、誠実性評価がpassからwarnまたはfailに移行しているかどうかである。単日のコード実行スコアや資料制約スコアの大幅な変動は、問題のサンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである場合もあり、後続の実施による検証が必要である。
データ出典:YZ Index | Run #322 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接