2026年8月10日のYZ Index Smoke速測は10モデルを対象とし、DeepSeek V4 Proが87.2点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観察に適しているが、Fullウィークリーランキングの結論とは同等ではない。
今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価としてではなく、モニタリングシグナルとして活用することが望ましい。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | DeepSeek V4 Pro | 87.2 | 91.7 | 81.7 | pass |
| #2 | Grok 4 | 73.52 | 75 | 71.7 | pass |
| #3 | Gemini 2.5 Pro | 72.86 | 73.8 | 71.7 | pass |
| #4 | Claude Opus 4.7 | 72.3 | 75 | 69 | pass |
| #5 | GPT-o3 | 71.27 | 75 | 66.7 | pass |
| #6 | Gemini 3.1 Pro | 66.7 | 66.7 | 66.7 | pass |
| #7 | Qwen3 Max | 65.01 | 75 | 52.8 | pass |
| #8 | GLM-4.6 | 61.25 | 50 | 75 | pass |
| #9 | GPT-5.5 | 58.31 | 75 | 37.9 | pass |
| #10 | Claude Sonnet 4.6 | 55.27 | 50 | 61.7 | pass |
データ解説
本日のYZ Index Smoke速測において、DeepSeek V4 Proはメインランキング87.2で首位を獲得した。コード実行91.7と資料制約81.7がバランスよく高水準を維持しており、重み0.55と0.45のもとで総合的に突出したパフォーマンスを示した。Grok 4はメインランキング73.52・コード実行75・資料制約71.7、Gemini 2.5 Proはメインランキング72.86・コード実行73.8・資料制約71.7、Claude Opus 4.7はメインランキング72.3・コード実行75・資料制約69、GPT-o3はメインランキング71.27・コード実行75・資料制約66.7となり、いずれもコード実行が資料制約をわずかに上回る構造的特徴を示した。GLM-4.6はコード実行50・資料制約75と逆の組み合わせを示し、メインランキングは61.25。Qwen3 Maxはコード実行75・資料制約52.8でメインランキング65.01となっており、このような強弱の組み合わせはランキングでよく見られる。
前回の同条件runと比較すると、GPT-5.5はメインランキングが30.4点下降し、コード実行が25点、資料制約が37.1点それぞれ低下した。GPT-o3はメインランキングが24.6点下降し、コード実行が25点、資料制約が24.2点低下した。Qwen3 Maxはメインランキングが20.8点下降し、コード実行が24点、資料制約が16.9点低下した。Claude Opus 4.7はメインランキングが20.6点下降し、コード実行が25点、資料制約が15.1点低下した。一方、GLM-4.6はメインランキングが23.5点上昇し、資料制約が52.2点上昇した。これらの変化は設問のサンプリングによる変動に起因する可能性もあれば、単日シグナルの偶発的な表れである可能性もあり、後続のrunによる検証が必要である。Smokeは小サンプルの単日シグナルであり、現時点のデータは参考情報に留まり、長期的な判断の根拠とはならない。
主な変化
- GPT-5.5:メインランキング30.4点下降、コード実行-25点、資料制約-37.1点
- GPT-o3:メインランキング24.6点下降、コード実行-25点、資料制約-24.2点、誠実性 warn→pass
- GLM-4.6:メインランキング23.5点上昇、資料制約+52.2点、誠実性 warn→pass
- Qwen3 Max:メインランキング20.8点下降、コード実行-24点、資料制約-16.9点
- Claude Opus 4.7:メインランキング20.6点下降、コード実行-25点、資料制約-15.1点
注目すべきシグナル
- 今回は公表可能な異常シグナルは確認されなかった。
この種のSmoke速報を読む際は、2つの点に注目すべきである。第一に、あるモデルが複数日連続して同種の弱点を示していないか。第二に、誠実性評価がpassからwarnまたはfailへ移行していないか。単日のコード実行または資料制約スコアの大幅な変動は、設問のサンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである場合もあり、後続のrunによる確認が必要である。
データ出典:YZ Index | Run #272 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接