2026-08-01のYZ Index Smoke速測は11モデルを対象とし、Claude Opus 4.7とQwen3 Maxが93.39点で同日首位に並んだ。Smokeは毎日10問の速測であり、短期的なシグナルの観察に適しているが、Fullの週次ランキングの結論とは同等ではない。
今回のSmoke評価はコード実行と資料制約の2つの主要ランキング次元のみを対象とし、主要ランキングの計算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な結論としてではなく、監視シグナルとして参照するにとどめるべきである。
当日ランキング
| 順位 | モデル | 主要スコア | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 93.39 | 100 | 85.3 | pass |
| #2 | Qwen3 Max | 93.39 | 100 | 85.3 | pass |
| #3 | DeepSeek V4 Pro | 90.99 | 98.5 | 81.8 | pass |
| #4 | Doubao Pro | 88.62 | 100 | 74.7 | pass |
| #5 | Gemini 3.1 Pro | 82.16 | 75 | 90.9 | pass |
| #6 | GPT-o3 | 79.28 | 81.8 | 76.2 | pass |
| #7 | GLM-4.6 | 76.47 | 100 | 47.7 | warn |
| #8 | Grok 4 | 69.56 | 75 | 62.9 | pass |
| #9 | GPT-5.5 | 66 | 58.3 | 75.4 | pass |
| #10 | Gemini 2.5 Pro | 60.81 | 56.8 | 65.7 | pass |
| #11 | Claude Sonnet 4.6 | 55.02 | 51.6 | 59.2 | pass |
データ解説
本日のYZ Index Smoke速測において、Claude Opus 4.7とQwen3 Maxが主要スコア93.39点で同点となり、両モデルともコード実行100点・資料制約85.3点を記録し、コード実行と資料制約のバランスが取れた高水準の組み合わせを示した。DeepSeek V4 Proは主要スコア90.99点、コード実行98.5点・資料制約81.8点で、引き続き高いコード実行能力を維持している。Doubao Proは主要スコア88.62点で、コード実行100点に対し資料制約74.7点と、コード実行が突出している一方で資料制約が相対的に弱いという構造的特徴を示している。Gemini 3.1 Proの主要スコアは82.16点で逆の傾向を示し、コード実行75点・資料制約90.9点と、資料制約が主な強みとなっている。
GLM-4.6は主要スコア76.47点で、コード実行100点に対し資料制約はわずか47.7点にとどまり、誠実性評価もpassからwarnに転落した。資料制約は前回の実行から-27.3点の変化が見られた。Qwen3 Maxは前回比で主要スコアが21.1点上昇し、資料制約が37.6点上昇した。GPT-5.5は主要スコア66点、コード実行58.3点・資料制約75.4点で、前回比で主要スコアが20.6点、コード実行が36.7点それぞれ下落した。Claude Sonnet 4.6は主要スコア55.02点、コード実行51.6点・資料制約59.2点で、前回比で主要スコアが19点、コード実行が48.4点それぞれ下落した。
異常シグナルとして、GPT-o3の主要スコアが13.9点・資料制約が14.7点下落、GLM-4.6の資料制約が27.3点下落、Grok 4の主要スコアが8.2点下落、GPT-5.5の主要スコアが20.6点下落、Gemini 2.5 Proの主要スコアが8.5点下落、Claude Sonnet 4.6の主要スコアが19点下落した。これらの単日変動は問題のサンプリングばらつきに起因する可能性もあれば、実際の性能変化を反映している可能性もあり、今後同一条件での再実行による確認が必要である。Smoke速測は小サンプルの単日シグナルであり、以上の観察は当日データの参考情報にすぎない。
主な変化
- GLM-4.6:主要スコア+30.2点、コード実行+77.2点、資料制約-27.3点、誠実性 pass→warn
- Qwen3 Max:主要スコア+21.1点、コード実行+7.5点、資料制約+37.6点
- GPT-5.5:主要スコア-20.6点、コード実行-36.7点
- Claude Sonnet 4.6:主要スコア-19点、コード実行-48.4点、資料制約+16.9点
- GPT-o3:主要スコア-13.9点、コード実行-13.2点、資料制約-14.7点
注目すべきシグナル
- GPT-o3:主要スコア急落 -13.9点
- GLM-4.6:資料制約急落 -27.3点
- Grok 4:主要スコア急落 -8.2点
- GPT-5.5:主要スコア急落 -20.6点
- Gemini 2.5 Pro:主要スコア急落 -8.5点
- Claude Sonnet 4.6:主要スコア急落 -19点
このようなSmoke速報を読む際は、2点に注目すべきである。第1に、あるモデルが複数日にわたって同種の弱点を繰り返し示していないか。第2に、誠実性評価がpassからwarnまたはfailに移行していないか。単日のコード実行スコアや資料制約スコアの大幅な変動は、問題のサンプリングに起因する場合もあれば、実際の性能劣化の初期シグナルである可能性もあり、今後の再実行による確認が必要である。
データ出典:YZ Index | Run #256 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接