2026-08-28のYZ Index Smoke速測は11モデルを対象に実施され、Claude Opus 4.7が93.54点で当日首位となった。Smokeは1日10問の速測であり、短期シグナルの観察に適しているが、フル週間ランキングの結論とは同等ではない。
今回のSmoke評価はコード実行とマテリアル制約の2つのメインランキング次元のみをカバーしており、メインランキングの算式は0.55 × コード実行 + 0.45 × マテリアル制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な評価ではなく、モニタリングシグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | マテリアル制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 93.54 | 97 | 89.3 | pass |
| #2 | GPT-o3 | 89.92 | 100 | 77.6 | pass |
| #3 | Gemini 2.5 Pro | 88.57 | 100 | 74.6 | pass |
| #4 | Doubao Pro | 86.92 | 97 | 74.6 | pass |
| #5 | Qwen3 Max | 86.87 | 99.2 | 71.8 | pass |
| #6 | GPT-5.5 | 85.93 | 97 | 72.4 | pass |
| #7 | Grok 4 | 85.49 | 96.2 | 72.4 | warn |
| #8 | Claude Sonnet 4.6 | 83.77 | 97 | 67.6 | pass |
| #9 | Gemini 3.1 Pro | 63.55 | 54.5 | 74.6 | pass |
| #10 | GLM-4.6 | 61.07 | 50 | 74.6 | pass |
| #11 | DeepSeek V4 Pro | 58.43 | 47 | 72.4 | pass |
データ解説
本日のYZ Index Smoke速測では、Claude Opus 4.7がメインランキング93.54で首位を獲得し、コード実行97とマテリアル制約89.3の組み合わせが最もバランスに優れている。GPT-o3とGemini 2.5 Proはいずれもコード実行100を強みとするが、マテリアル制約はそれぞれ77.6と74.6にとどまり、その結果メインランキングスコアは89.92と88.57に留まった。Doubao ProとQwen3 Maxのコード実行はそれぞれ97と99.2、マテリアル制約は74.6と71.8であり、同様にコード側がより強いという構造的特徴を示している。
Gemini 3.1 Proはメインランキングが25.2点、コード実行が45.5点下落し、GLM-4.6もメインランキングが25.2点下落、コード実行が25点、マテリアル制約が25.4点下落した。GPT-o3はメインランキングが10.1点、マテリアル制約が22.4点下落した。これらの変動は単日の問題サンプリングのばらつき、あるいは特定の制約シナリオにおけるモデルの一時的なパフォーマンス変化に起因する可能性があり、同条件での後続runによる確認が必要である。Grok 4とGPT-5.5のメインランキングはそれぞれ8点・9.1点下落しており、マテリアル制約側の変動についても継続的な観察が求められる。
全体的に見ると、上位モデルのコード実行とマテリアル制約における強弱の組み合わせは引き続き安定しているが、中下位モデルの顕著なスコア変動は、Smoke速測が小サンプルの単日シグナルにすぎないことを改めて示しており、いかなる解釈も慎重に行う必要がある。
主な変化
- Gemini 3.1 Pro:メインランキング-25.2点、コード実行-45.5点
- GLM-4.6:メインランキング-25.2点、コード実行-25点、マテリアル制約-25.4点
- GPT-o3:メインランキング-10.1点、マテリアル制約-22.4点
- DeepSeek V4 Pro:メインランキング+9.4点、コード実行+22点、マテリアル制約-6点
- GPT-5.5:メインランキング-9.1点、マテリアル制約-16.5点
注目すべきシグナル
- GPT-o3:メインランキング急落 -10.1点
- GPT-5.5:メインランキング急落 -9.1点
- Grok 4:メインランキング急落 -8点
- Gemini 3.1 Pro:メインランキング急落 -25.2点
- GLM-4.6:メインランキング急落 -25.2点
このようなSmoke速報を読む際は、2つの点に重点を置くべきである。第一に、特定のモデルが同じ種類の弱点を複数日にわたって連続して示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに変化しているかどうか。単日のコード実行またはマテリアル制約スコアの大幅な変動は、問題サンプリングに起因する場合もあれば、実際のパフォーマンス劣化の早期シグナルである可能性もあり、後続runによる確認が必要である。
データ出典:YZ Index | Run #298 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接