2026年7月22日のYZ Index Smoke速測は11モデルを対象とし、Grok 4が98.35点で当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観測に適しており、フル週間ランキングの結論とは同一ではない。
今回のSmoke評価はコード実行と資料制約の2つのメインランキング軸のみを対象としており、メインランキングの算式は 0.55 × コード実行 + 0.45 × 資料制約 である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な結論ではなく、モニタリングシグナルとして活用することが望ましい。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Grok 4 | 98.35 | 97 | 100 | pass |
| #2 | Claude Sonnet 4.6 | 96.7 | 94 | 100 | warn |
| #3 | DeepSeek V4 Pro | 96.7 | 94 | 100 | pass |
| #4 | GPT-5.5 | 96.7 | 94 | 100 | pass |
| #5 | Claude Opus 4.7 | 92.61 | 94 | 90.9 | pass |
| #6 | Qwen3 Max | 92.61 | 94 | 90.9 | pass |
| #7 | GPT-o3 | 87.94 | 88.3 | 87.5 | warn |
| #8 | Doubao Pro | 87.1 | 97 | 75 | pass |
| #9 | GLM-4.6 | 74 | 97 | 75 | fail |
| #10 | Gemini 3.1 Pro | 71.7 | 69 | 75 | pass |
| #11 | Gemini 2.5 Pro | 55.63 | 50 | 62.5 | pass |
データ解説
本日のYZ Index Smoke速測において、上位モデルのコード実行と資料制約のバランスに明確な差異が見られた。Grok 4はメインランキング98.35でトップに立ち、コード実行97・資料制約100、誠実性はpassとなった。Claude Sonnet 4.6・DeepSeek V4 Pro・GPT-5.5の3モデルはメインランキング同点の96.7で、コード実行94・資料制約100、誠実性はそれぞれwarn・pass・passとなった。Claude Opus 4.7とQwen3 Maxはメインランキング92.61、コード実行94・資料制約90.9、誠実性はpassとなった。Doubao Proはコード実行97を記録したが資料制約が75にとどまり、メインランキングは87.1となった。GLM-4.6も同様にコード実行97・資料制約75で、メインランキングは74かつ誠実性がfailとなった。
顕著な変動があったモデルとして、Gemini 2.5 Proはメインランキング55.63と同条件比で24.6点下落し、コード実行50・資料制約62.5となった。Claude Opus 4.7はメインランキングが18.7点上昇し、コード実行と資料制約はそれぞれ19点・18.3点上昇した。Qwen3 Maxはメインランキングが13.2点上昇し、資料制約が18.3点上昇した。GLM-4.6はコード実行が47点上昇したが、誠実性がpassからfailに転落した。Grok 4は資料制約が16.7点上昇した。GPT-o3のメインランキングは87.94で、前回比8.3点下落した。
上記のスコア変動は、1日10問のサンプリングによる揺らぎに起因する可能性がある一方、特定の制約下におけるモデルの実際のパフォーマンス差を反映している可能性もあり、今後の同条件での再実行による確認が必要である。Smoke速測は小サンプルの単日シグナルであり、解釈は当日データの比較に限定され、長期的な推論には用いない。
主な変動
- Gemini 2.5 Pro:メインランキング -24.6点、コード実行 -20.8点、資料制約 -29.2点
- Claude Opus 4.7:メインランキング +18.7点、コード実行 +19点、資料制約 +18.3点
- Qwen3 Max:メインランキング +13.2点、コード実行 +9点、資料制約 +18.3点
- GLM-4.6:メインランキング +11.2点、コード実行 +47点、誠実性 pass→fail
- Grok 4:メインランキング +9.6点、資料制約 +16.7点
注目すべきシグナル
- GPT-o3:メインランキング急落 -8.3点
- GLM-4.6:誠実性評価がFailに低下(pass→fail)
- Gemini 2.5 Pro:メインランキング急落 -24.6点
このSmoke速報を読む際は、2つの点に重点を置くべきである。第一に、あるモデルが複数日にわたって同種の弱点を露呈し続けているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうかである。単日のコード実行や資料制約スコアの大幅な変動は、問題のサンプリングによるものである可能性もあれば、実際の性能低下の初期シグナルである可能性もあり、後続の再実行による確認が必要である。
データ出典:YZ Index | Run #241 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接