2026-07-29のYZ Index Smoke速測は10モデルを対象とし、Grok 4が89.3点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観測に適しているが、週次Full総合ランキングの結論とは同一視できない。
今回のSmokeは、コード実行とマテリアル制約の2つのメインランキング次元のみを対象とし、メインランキングの算出式は0.55 × コード実行 + 0.45 × マテリアル制約である。1日あたりのサンプル数は少ないため、単日スコアはモデル能力の長期的な評価としてではなく、モニタリングシグナルとして活用することが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | マテリアル制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Grok 4 | 89.3 | 97.8 | 78.9 | pass |
| #2 | DeepSeek V4 Pro | 83.53 | 100 | 63.4 | warn |
| #3 | Doubao Pro | 81.88 | 97 | 63.4 | pass |
| #4 | GPT-o3 | 79.43 | 72.5 | 87.9 | pass |
| #5 | Gemini 3.1 Pro | 77.7 | 78.6 | 76.6 | pass |
| #6 | Claude Opus 4.7 | 76.76 | 75 | 78.9 | pass |
| #7 | Claude Sonnet 4.6 | 70.77 | 75 | 65.6 | pass |
| #8 | Qwen3 Max | 68.05 | 72.5 | 62.6 | pass |
| #9 | GPT-5.5 | 66.68 | 75 | 56.5 | pass |
| #10 | Gemini 2.5 Pro | 58.91 | 50 | 69.8 | pass |
データ解説
今回のYZ Index Smoke速測において、上位モデルはコード実行とマテリアル制約の組み合わせに明確な差異が見られた。Grok 4はメインランキング89.3で首位に立ち、コード実行97.8・マテリアル制約78.9のバランスの取れた組み合わせがその優位性を形成している。DeepSeek V4 Proはコード実行が100に達したが、マテリアル制約は63.4にとどまり、メインランキング83.53で2位。Doubao Proはコード実行97・マテリアル制約63.4で、メインランキング81.88と続く。一方、GPT-o3はコード実行72.5ながらマテリアル制約87.9でメインランキング79.43を獲得し、Gemini 3.1 Proはコード実行78.6・マテリアル制約76.6でメインランキング77.7となっており、マテリアル制約が高いモデルが総合ランキングでも競争力を維持していることが示された。
主な変動としては、Claude Opus 4.7のメインランキングが20.3上昇し、コード実行が50上昇・マテリアル制約が16.1下降した。GPT-5.5のメインランキングは27下降し、コード実行-25・マテリアル制約-29.4。Gemini 3.1 Proのメインランキングは22.3下降し、コード実行-21.4・マテリアル制約-23.4。Gemini 2.5 Proのメインランキングは18.7下降し、コード実行-20.8・マテリアル制約-16.1。GPT-o3のメインランキングは18.3下降し、コード実行-27.5・マテリアル制約-7.1となった。これらの単日変動は問題のサンプリング揺らぎに起因する可能性もあれば、モデルの実際のパフォーマンスにおける短期的な変化を反映している可能性もあり、同条件での追加検証が必要である。
小サンプルによる単日シグナルとして、本データは即時参考情報を提供するにとどまる。異常シグナルは確認されず、過度な推論を避けるため解釈は慎重に行う。
主な変動
- GPT-5.5:メインランキング-27点、コード実行-25点、マテリアル制約-29.4点
- Gemini 3.1 Pro:メインランキング-22.3点、コード実行-21.4点、マテリアル制約-23.4点
- Claude Opus 4.7:メインランキング+20.3点、コード実行+50点、マテリアル制約-16.1点
- Gemini 2.5 Pro:メインランキング-18.7点、コード実行-20.8点、マテリアル制約-16.1点
- GPT-o3:メインランキング-18.3点、コード実行-27.5点、マテリアル制約-7.1点
注目すべきシグナル
- 今回、公表可能な異常シグナルは確認されなかった。
このようなSmokeブリーフィングを読む際は、主に2点に注目すべきである。第一に、あるモデルが複数日連続して同種の弱点を示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行・マテリアル制約スコアの大幅な変動は、問題サンプリングの揺らぎによるものである可能性もあれば、実際の性能劣化の初期シグナルである可能性もあり、追加の検証実施が必要である。
データ出典:YZ Index | Run #252 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接