2026年7月25日のYZ Index Smokeクイックテストは11モデルを対象に実施され、Claude Sonnet 4.6とGrok 4が96.98点で当日首位に並んだ。Smokeは1日10問のクイックテストであり、短期シグナルの観察に適しているが、Fullの週次ランキングの結論とは同一視できない。
今回のSmoke評価はコード実行と資料制約の2つのメインランキング次元のみを対象としており、メインランキングの算式は 0.55 × コード実行 + 0.45 × 資料制約 である。1日あたりのサンプル数が少ないため、単日のスコアはモデル能力の長期的な判断ではなく、監視シグナルとして活用するのが適切である。
当日ランキング
| 順位 | モデル | メインランキング | コード実行 | 資料制約 | 誠実性 |
|---|---|---|---|---|---|
| #1 | Claude Sonnet 4.6 | 96.98 | 94.5 | 100 | pass |
| #2 | Grok 4 | 96.98 | 94.5 | 100 | pass |
| #3 | DeepSeek V4 Pro | 92.16 | 94.5 | 89.3 | pass |
| #4 | GPT-5.5 | 87.17 | 94.5 | 78.2 | pass |
| #5 | Gemini 3.1 Pro | 80.91 | 94.5 | 64.3 | pass |
| #6 | GPT-o3 | 80.91 | 94.5 | 64.3 | pass |
| #7 | Gemini 2.5 Pro | 80.73 | 94.5 | 63.9 | pass |
| #8 | Claude Opus 4.7 | 78.41 | 69.5 | 89.3 | pass |
| #9 | Doubao Pro | 71.98 | 69.5 | 75 | pass |
| #10 | GLM-4.6 | 64.66 | 44.5 | 89.3 | pass |
| #11 | Qwen3 Max | 53.41 | 44.5 | 64.3 | pass |
データ解説
本日のメインランキングでは、Claude Sonnet 4.6とGrok 4がいずれも96.98点を獲得し、コード実行は両者とも94.5、資料制約は両者とも100であり、2つの能力次元においてバランスの取れた高水準の組み合わせを示している。DeepSeek V4 Proは92.16点で3位につけ、コード実行は同じく94.5だが、資料制約は89.3と上位2モデルをやや下回る。GPT-5.5のメインスコアは87.17点で、コード実行94.5・資料制約78.2となっており、コード実行が資料制約に対して相対的に優位な構造的特徴を示している。
複数のモデルで顕著なプラス変化が見られ、Claude Sonnet 4.6はメインランキングで38.3点上昇・コード実行で44.5点上昇・資料制約で30.7点上昇、DeepSeek V4 Proはメインランキングで23.5点上昇・コード実行で19.5点上昇・資料制約で28.4点上昇、Gemini 3.1 Proはメインランキングで21.4点上昇・コード実行で36.2点上昇となった。これらの変動幅はいずれも単日の小サンプルSmokeテストによるものであり、設問のサンプリングによるばらつきである可能性も、特定の制約条件下でのモデルパフォーマンスの変動である可能性もあり、安定性を確認するためには同一条件での後続実施による検証が必要である。
全体として、上位モデルの多くはコード実行と資料制約の強弱が互いに補完し合う構造を示している一方、GLM-4.6(コード実行44.5・資料制約89.3)やQwen3 Max(コード実行44.5・資料制約64.3)など中位モデルの一部では構造的差異が明確に見られる。すべての解釈は本日のデータに基づくものであり、長期的なパフォーマンスについての判断は行っていない。
主な変化
- Claude Sonnet 4.6:メインランキング+38.3点、コード実行+44.5点、資料制約+30.7点
- DeepSeek V4 Pro:メインランキング+23.5点、コード実行+19.5点、資料制約+28.4点
- Gemini 3.1 Pro:メインランキング+21.4点、コード実行+36.2点
- GPT-o3:メインランキング+16点、コード実行+19.5点、資料制約+11.7点
- GPT-5.5:メインランキング+13.3点、コード実行+19.5点、資料制約+5.6点
注目すべきシグナル
- 今回は公表すべき異常シグナルは検出されなかった。
この種のSmoke速報を読む際は、2つの点に着目すべきである。第一に、あるモデルが複数日連続して同種の弱点を露呈していないか。第二に、誠実性評価がpassからwarnまたはfailに移行していないか。単日のコード実行または資料制約スコアの大幅な変動は、設問のサンプリングに起因する場合もあれば、実際の性能低下の早期シグナルである可能性もあり、後続の実施による検証が必要である。
データ出典:YZ Index | Run #245 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接