2026-09-29 YZ Index Smokeテストは10モデルを対象に実施され、Claude Opus 4.7とGPT-5.5がともに80.2点で当日首位に並んだ。Smokeは毎日10問の速測であり、短期的なシグナルの観察に適しているが、Fullの週間ランキングと同等の結論を意味するものではない。
今回のSmoke評価はコード実行とマテリアル制約の2つの主要ランキング指標のみを対象としており、主要ランキングの計算式は0.55 × コード実行 + 0.45 × マテリアル制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な判断ではなく、モニタリングシグナルとして活用することが適切である。
当日ランキング
| 順位 | モデル | 主要ランキング | コード実行 | マテリアル制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 80.2 | 100 | 56 | pass |
| #2 | GPT-5.5 | 80.2 | 100 | 56 | pass |
| #3 | Doubao Pro | 76.25 | 96.9 | 51 | warn |
| #4 | Qwen3 Max | 75.91 | 92.2 | 56 | warn |
| #5 | GPT-o3 | 73.78 | 93.8 | 49.3 | warn |
| #6 | Grok 4 | 69.98 | 94.5 | 40 | pass |
| #7 | Claude Sonnet 4.6 | 66.3 | 87 | 41 | pass |
| #8 | Gemini 3.1 Pro | 54.95 | 50 | 61 | pass |
| #9 | DeepSeek V4 Pro | 45.7 | 25 | 71 | warn |
| #10 | Gemini 2.5 Pro | 41.2 | 25 | 61 | pass |
データ解説
本日の主要ランキング上位2位であるClaude Opus 4.7とGPT-5.5はともに主要ランキング80.2を記録し、コード実行はともに100、マテリアル制約はともに56となっており、両者がコード実行とマテリアル制約の組み合わせにおいて均衡の取れた高水準を示している。Doubao Proの主要ランキングは76.25でコード実行96.9・マテリアル制約51、Qwen3 Maxは主要ランキング75.91でコード実行92.2・マテリアル制約56となっており、上位モデル全体としてコード実行が比較的強くマテリアル制約が中程度という構造的特徴が見られる。Gemini 3.1 Proの主要ランキングは54.95でコード実行50・マテリアル制約61、DeepSeek V4 Proは主要ランキング45.7でコード実行25・マテリアル制約71となっており、マテリアル制約が相対的に強いという異なる組み合わせを示している。
Claude Sonnet 4.6の主要ランキングは前回同条件のrunと比較して25.5点下降し、コード実行は13点、マテリアル制約は40.8点それぞれ低下した。DeepSeek V4 Proの主要ランキングは25.2点下降し、コード実行は50点低下、マテリアル制約は5.1点上昇した。Gemini 2.5 Proの主要ランキングは22.9点下降し、コード実行は45点低下した。Grok 4の主要ランキングは21.8点下降し、コード実行は5.5点、マテリアル制約は41.8点それぞれ低下した。Qwen3 Maxの主要ランキングは15.9点下降し、マテリアル制約は34.9点低下した。これらのスコア変化は問題のサンプリングのばらつきに起因する可能性もあれば、単日の実際のパフォーマンス差を反映している可能性もあり、後続runでの検証が必要である。Smokeは小サンプルの単日シグナルであるため、上記の解説は本日のデータ構造のみを対象としており、長期的な判断は行わない。
主な変化
- Claude Sonnet 4.6:主要ランキング-25.5点、コード実行-13点、マテリアル制約-40.8点
- DeepSeek V4 Pro:主要ランキング-25.2点、コード実行-50点、マテリアル制約+5.1点
- Gemini 2.5 Pro:主要ランキング-22.9点、コード実行-45点
- Grok 4:主要ランキング-21.8点、コード実行-5.5点、マテリアル制約-41.8点
- Qwen3 Max:主要ランキング-15.9点、マテリアル制約-34.9点
注目すべきシグナル
- 今回は公表可能な異常シグナルは確認されなかった。
この種のSmoke速報を読む際は、2つの点に注目すべきである。第一に、特定のモデルが複数日連続して同種の弱点を示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailへ移行しているかどうか。単日のコード実行またはマテリアル制約スコアの大幅な変化は、問題のサンプリングに起因する場合もあれば、実際の性能低下の初期シグナルである可能性もあり、後続runでの検証が必要である。
データ出典:YZ Index | Run #344 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接