2026-08-03のYZ Index Smokeクイックテストは11モデルを対象とし、Claude Opus 4.7が95.19点で当日首位となった。Smokeは毎日10問のクイックテストであり、短期シグナルの観測に適しているが、週次Fullランキングの結論とは同等ではない。
今回のSmokeテストはコード実行と資料制約の2つのメイン指標のみをカバーしており、メインスコアの算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモニタリングシグナルとして参照するものであり、モデルの能力に対する長期的な結論としては適さない。
当日ランキング
| 順位 | モデル | メイン | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 95.19 | 100 | 89.3 | pass |
| #2 | Grok 4 | 89.31 | 97.9 | 78.8 | pass |
| #3 | Gemini 2.5 Pro | 78.5 | 98.7 | 53.8 | pass |
| #4 | GPT-5.5 | 74.75 | 83.3 | 64.3 | pass |
| #5 | GPT-o3 | 74.75 | 83.3 | 64.3 | pass |
| #6 | GLM-4.6 | 72.25 | 58.3 | 89.3 | pass |
| #7 | DeepSeek V4 Pro | 70.19 | 75 | 64.3 | pass |
| #8 | Claude Sonnet 4.6 | 62.96 | 50 | 78.8 | pass |
| #9 | Gemini 3.1 Pro | 60.62 | 57.6 | 64.3 | pass |
| #10 | Qwen3 Max | 58.94 | 75 | 39.3 | pass |
| #11 | Doubao Pro | 55.89 | 57.6 | 53.8 | pass |
データ解説
本日のSmokeクイックテストでは、Claude Opus 4.7がメインスコア95.19で首位となり、コード実行100・資料制約89.3の組み合わせが優位性をもたらした。Grok 4はそれに続きメインスコア89.31、コード実行97.9・資料制約78.8を記録。Gemini 2.5 Proはコード実行98.7を達成したものの資料制約は53.8にとどまり、メインスコアは78.5となった。GLM-4.6は資料制約89.3・コード実行58.3の組み合わせでメインスコア72.25を記録しており、上位モデルが0.55×コード実行+0.45×資料制約の算式のもとで異なるウェイトバランスを示す結果となった。
複数モデルで顕著な下落が見られた。Doubao Proはメインスコアが40.8点低下し、コード実行は36.4点、資料制約は46.2点それぞれ低下した。Qwen3 Maxはメインスコアが37.2点低下し、コード実行22点・資料制約55.7点の低下を記録。Gemini 3.1 Proはメインスコアが33.8点低下し、コード実行36.4点・資料制約30.7点それぞれ低下した。これらの変動は単日小サンプルのサンプリング誤差に起因する可能性もあるが、実際の性能劣化を反映している可能性もあり、同条件での再実行による確認が必要である。
Claude Sonnet 4.6とDeepSeek V4 Proもそれぞれメインスコアが31.5点・24.3点低下し、コード実行・資料制約ともに下落した。全体の構造としては誠実性passの記録を維持している。Smokeは小サンプルの単日シグナルであり、現時点のデータはあくまで参考として提供されるものであり、長期的な推論の根拠とはならない。
主な変動
- Doubao Pro:メインスコア40.8点低下、コード実行-36.4点、資料制約-46.2点
- Qwen3 Max:メインスコア37.2点低下、コード実行-22点、資料制約-55.7点
- Gemini 3.1 Pro:メインスコア33.8点低下、コード実行-36.4点、資料制約-30.7点
- Claude Sonnet 4.6:メインスコア31.5点低下、コード実行-44点、資料制約-16.2点
- DeepSeek V4 Pro:メインスコア24.3点低下、コード実行-19点、資料制約-30.7点、誠実性warn→pass
注目すべきシグナル
- 今回は公表すべき異常シグナルは確認されなかった。
このようなSmoke速報を読む際は、主に2点に着目すべきである。第一に、特定のモデルが複数日にわたって同種の弱点を継続的に露呈しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行・資料制約スコアの大幅な変動は、問題のサンプリングに起因する場合もあれば、実際の性能劣化の初期シグナルである場合もあり、その後の再実行による検証が必要である。
データ出典:YZ Index | Run #258 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接