2026-09-06のYZ Index Smoke速報テストは11モデルを対象とし、Gemini 2.5 Proが88.21点で当日首位を獲得した。Smokeは毎日10問による速報テストであり、短期シグナルの観測に適しているが、Fullウィークリーランキングの結論と同等ではない。
今回のSmoke評価はコード実行とマテリアル制約の2つのメインランキング次元のみを対象としており、メインランキングの計算式は 0.55 × コード実行 + 0.45 × マテリアル制約 である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な判断ではなく、モニタリングシグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | マテリアル制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Gemini 2.5 Pro | 88.21 | 90.1 | 85.9 | pass |
| #2 | Gemini 3.1 Pro | 79.19 | 86.7 | 70 | pass |
| #3 | DeepSeek V4 Pro | 77.44 | 91.7 | 60 | pass |
| #4 | GPT-o3 | 72.75 | 75 | 70 | pass |
| #5 | Grok 4 | 68.66 | 75 | 60.9 | pass |
| #6 | Claude Sonnet 4.6 | 68.32 | 70.3 | 65.9 | pass |
| #7 | GPT-5.5 | 67.75 | 70 | 65 | pass |
| #8 | Doubao Pro | 66.16 | 50 | 85.9 | pass |
| #9 | GLM-4.6 | 63.66 | 70 | 55.9 | pass |
| #10 | Claude Opus 4.7 | 61.25 | 50 | 75 | pass |
| #11 | Qwen3 Max | 57.33 | 54.4 | 60.9 | warn |
データ解説
本日のYZ Index Smoke速報テストにおいて、Gemini 2.5 Proはメインランキング88.21で首位を獲得し、コード実行90.1とマテリアル制約85.9がバランスよく揃った。Gemini 3.1 Proはメインランキング79.19、コード実行86.7、マテリアル制約70となり、コード実行が相対的に突出している。DeepSeek V4 Proはメインランキング77.44、コード実行91.7、マテリアル制約60で、コード実行が強い一方マテリアル制約が弱いという構造的特徴が見られる。GPT-o3はメインランキング72.75、コード実行75、マテリアル制約70と、全体的にバランスの取れた構成となっている。
同条件の前回実行との比較では、Gemini 2.5 Proがメインランキング+31.4点・コード実行+40.1点・マテリアル制約+20.7点、DeepSeek V4 Proがメインランキング+16.6点・コード実行+41.7点・マテリアル制約-14.2点、Claude Opus 4.7がメインランキング-24.9点・コード実行-50点・マテリアル制約+5.8点、GPT-o3がメインランキング-17.9点・コード実行-25点・マテリアル制約-9.2点、Doubao Proがメインランキング-17.8点・コード実行-46点・マテリアル制約+16.7点となっている。異常シグナルは確認されず、上記のスコア変動は問題のサンプリングによるばらつきに起因する可能性もあれば、実際の性能低下を反映している可能性もあり、シグナルの安定性を確認するには後続の実行による検証が必要である。
Smokeは小サンプルの単日シグナルであるため、上記の解説はあくまで当日のデータ構造に基づく記述であり、モデルの長期的なパフォーマンスについての判断を行うものではない。
主な変動
- Gemini 2.5 Pro:メインランキング+31.4点、コード実行+40.1点、マテリアル制約+20.7点
- Claude Opus 4.7:メインランキング-24.9点、コード実行-50点、マテリアル制約+5.8点
- GPT-o3:メインランキング-17.9点、コード実行-25点、マテリアル制約-9.2点
- Doubao Pro:メインランキング-17.8点、コード実行-46点、マテリアル制約+16.7点
- DeepSeek V4 Pro:メインランキング+16.6点、コード実行+41.7点、マテリアル制約-14.2点
注目すべきシグナル
- 今回、公表すべき異常シグナルは確認されなかった。
このようなSmoke速報を読む際は、2つの点に注目すべきである。第一に、あるモデルが複数日にわたって同種の弱点を継続的に露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行していないかどうか。単日のコード実行やマテリアル制約スコアの大幅な変動は、問題のサンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである場合もあるため、後続の実行による検証が必要である。
データ出典:YZ Index | Run #310 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接