2026-08-22のYZ Index Smoke速測は11モデルを対象とし、Claude Opus 4.7が100点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期シグナルの観測に適しているが、Fullウィークリーランキングの結論と同等ではない。
今回のSmoke評価はコード実行と資料制約の2つのメインランキング指標のみを対象とし、メインランキングの計算式は0.55 × コード実行 + 0.45 × 資料制約である。1日あたりのサンプル数が少ないため、単日スコアはモデル能力の長期的な判断ではなく、モニタリングシグナルとして参照するのが適切である。
当日ランキング
| 順位 | モデル | メイン | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Opus 4.7 | 100 | 100 | 100 | pass |
| #2 | Doubao Pro | 99.01 | 100 | 97.8 | pass |
| #3 | Qwen3 Max | 98.65 | 100 | 97 | pass |
| #4 | Grok 4 | 90.01 | 91.4 | 88.3 | pass |
| #5 | GPT-5.5 | 86.25 | 75 | 100 | pass |
| #6 | Claude Sonnet 4.6 | 84.9 | 75 | 97 | pass |
| #7 | Gemini 2.5 Pro | 83.39 | 69.8 | 100 | pass |
| #8 | GPT-o3 | 79.34 | 72 | 88.3 | pass |
| #9 | Gemini 3.1 Pro | 72.5 | 50 | 100 | pass |
| #10 | GLM-4.6 | 71.51 | 50 | 97.8 | pass |
| #11 | DeepSeek V4 Pro | 67.24 | 50 | 88.3 | pass |
データ解説
本日のYZ Index Smoke速測では、Claude Opus 4.7がコード実行100・資料制約100という均衡した構成でメインランキング100点の首位を獲得した。Doubao Proはコード実行100・資料制約97.8という高コード実行と中程度の資料制約の組み合わせで、メイン99.01と僅差で続いた。Qwen3 Maxもコード実行100・資料制約97、メイン98.65を記録し、上位モデルはコード実行が満点またはそれに近く、資料制約がやや低いという傾向が見られる。Grok 4はコード実行91.4・資料制約88.3でメイン90.01、GPT-5.5はコード実行75・資料制約100という資料制約がコード実行を上回る構成でメイン86.25となり、モデルによって2指標の強弱が異なることが示された。
Gemini 2.5 Proは前回同条件のrunと比較してメインが65点上昇し、コード実行が46.3点、資料制約が87.9点上昇、誠実性評価がfailからpassに転じた。GLM-4.6はメインが38.8点上昇し、コード実行が50点、資料制約が25点上昇、誠実性評価がwarnからpassに転じた。Doubao Proはメインが20.4点上昇し、コード実行が25点、資料制約が14.8点上昇した。これらの上昇幅は資料制約またはコード実行の単項目における顕著な改善に集中しており、サンプリングによる単日の変動かどうかを確認するため、後続のrunによる再検証が必要である。
Gemini 2.5 Proの誠実性評価にfail→passという異常シグナルが見られたが、これは問題のサンプリング変動や単回テストにおける一時的なパフォーマンス変化が原因である可能性がある一方、真の性能低下の兆候を反映している可能性もある。Smokeの少サンプル単日データでは両者を区別するには不十分であり、複数回の再検証を経てから判断することを推奨する。
主な変化
- Gemini 2.5 Pro:メイン+65点、コード実行+46.3点、資料制約+87.9点、誠実性 fail→pass
- GLM-4.6:メイン+38.8点、コード実行+50点、資料制約+25点、誠実性 warn→pass
- Gemini 3.1 Pro:メイン+22.5点、資料制約+50点、誠実性 warn→pass
- Doubao Pro:メイン+20.4点、コード実行+25点、資料制約+14.8点
- Qwen3 Max:メイン+19点、コード実行+25点、資料制約+11.7点、誠実性 warn→pass
注目すべきシグナル
- Gemini 2.5 Pro:誠実性評価が Fail に低下(fail→pass)
このようなSmoke速報を読む際は、2点に注目すべきである。第一に、特定のモデルが同じ種類の弱点を複数日にわたって連続して示しているかどうか。第二に、誠実性評価がpassからwarnまたはfailに移行しているかどうか。単日のコード実行または資料制約スコアの大幅な変化は、問題のサンプリングによるものである場合も、真の性能低下の早期シグナルである場合もあり、後続のrunによる再検証が必要である。
データ出典:YZ Index | Run #289 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接