2026年8月5日のYZ Index Smoke速測は9モデルをカバーし、DeepSeek V4 Pro・GPT-5.5・GPT-o3が80.52点で当日首位に並んだ。Smokeは毎日10問の速測であり、短期シグナルの観察に適しており、Full週間ランキングの結論と同一ではない。
今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみをカバーしており、メインランキングの計算式は 0.55 × コード実行 + 0.45 × 資料制約 である。日次サンプル数が少ないため、単日スコアはモデル能力の長期的な判断ではなく、モニタリングシグナルとして活用することが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | DeepSeek V4 Pro | 80.52 | 100 | 56.7 | pass |
| #2 | GPT-5.5 | 80.52 | 100 | 56.7 | pass |
| #3 | GPT-o3 | 80.52 | 100 | 56.7 | pass |
| #4 | Claude Sonnet 4.6 | 74.09 | 96.9 | 46.2 | pass |
| #5 | Gemini 2.5 Pro | 73.74 | 81.3 | 64.5 | pass |
| #6 | Claude Opus 4.7 | 71.94 | 75 | 68.2 | pass |
| #7 | Gemini 3.1 Pro | 55.52 | 75 | 31.7 | pass |
| #8 | Grok 4 | 55.52 | 75 | 31.7 | pass |
| #9 | Qwen3 Max | 49.72 | 71.9 | 22.6 | pass |
データ解説
本日のYZ Index Smoke速測において、DeepSeek V4 Pro・GPT-5.5・GPT-o3はメインランキング80.52で並び、コード実行はいずれも100点、資料制約はいずれも56.7点であり、コード実行で満点を獲得しつつ資料制約が中程度という構造的な組み合わせを示した。Claude Sonnet 4.6はメインランキング74.09、コード実行96.9・資料制約46.2で、同様にコード実行が強く資料制約がやや弱いという特徴を示した。Gemini 2.5 Proはメインランキング73.74、コード実行81.3・資料制約64.5で、両指標において相対的にバランスが取れているものの全体的にやや低めの組み合わせとなった。Claude Opus 4.7はメインランキング71.94、コード実行75・資料制約68.2で、資料制約のスコアがコード実行を上回るという別の組み合わせパターンを形成した。
前回同条件のrunと比較すると、Qwen3 Maxはメインランキングが35.1点低下し、コード実行が20.8点・資料制約が52.6点それぞれ低下した。Grok 4はメインランキングが28.8点低下し、コード実行が25点・資料制約が33.5点低下した。Gemini 3.1 Proはメインランキングが27.6点低下し、コード実行が22点・資料制約が34.4点低下した。これらの低下は資料制約とコード実行の両項目に集中しており、設問のサンプリングによる変動か真の性能劣化かを区別するため、後続のrunによる再検証が必要である。Smoke速測は小サンプルの単日シグナルであり、現在のデータは当日のパフォーマンスのみを反映するものであり、長期的な判断の根拠とはならない。
全体的に見ると、上位モデルの多くはコード実行の高スコアによってメインランキングを支えており、資料制約のスコアは全般的に低く、明確な構造的差異が生じている。異変を示したモデルが同時に低下している点は、単日テストの変動が存在する可能性を示唆しており、複数回の再テストを通じた安定性の確認が必要である。
主な変化
- Qwen3 Max:メインランキング35.1点低下、コード実行-20.8点、資料制約-52.6点
- Grok 4:メインランキング28.8点低下、コード実行-25点、資料制約-33.5点
- Gemini 3.1 Pro:メインランキング27.6点低下、コード実行-22点、資料制約-34.4点
- Claude Opus 4.7:メインランキング17.5点低下、コード実行-22点、資料制約-12点
- Gemini 2.5 Pro:メインランキング15.8点低下、コード実行-18.7点、資料制約-12.3点
注目すべきシグナル
- 今回、公表可能な異常シグナルは確認されなかった。
この種のSmoke速報を読む際は、二つの問いに重点を置くべきである。第一に、あるモデルが複数日にわたって同じ種類の弱点を示し続けているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行していないかどうか。単日のコード実行スコアや資料制約スコアの大幅な変化は、設問のサンプリングによるものである場合もあれば、真の性能劣化の早期シグナルである場合もあり、後続のrunによる再検証が必要である。
データ出典:YZ Index | Run #262 | 原始データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接