2026年7月28日〜8月2日の期間、Qwen3 MaxはSmoke評価において初日の59.28点から最終日の96.1点へと上昇し、トレンド値+36.8を記録。7日間で上昇幅が最も大きいモデルとなった。
上昇モデルのスコア推移とメカニズム
Doubao Proは92.07点から96.7点に上昇し、トレンド+4.6、平均84.9、変動21.7。Grok 4は84.47点から96.1点に上昇し、トレンド+11.6、平均82.5、変動26.5。DeepSeek V4 Proは84点から94.45点に上昇し、トレンド+10.5、平均87.8、変動20.1。Claude Sonnet 4.6は79.91点から94.45点に上昇し、トレンド+14.5、平均75.5、変動39.4。Gemini 2.5 Proは77.6点から96.1点に上昇し、トレンド+18.5、平均70.6、変動37.2。Claude Opus 4.7は56.5点から94.45点に上昇し、トレンド+38、平均83.4、変動38。
これらの上昇は主にメインランキングの「実行」と「資料制約」という2つの次元に集中している。DeepSeek V4 Proの平均87.8は上昇モデルの中で最高であり、コード実行および資料制約における日間一貫性が相対的に優れていることを示す。Qwen3 MaxとClaude Opus 4.7の最終日スコアはそれぞれ96.1点と94.45点に達しており、7日間を通じてトップモデルとの差を着実に縮めてきたことを示している。
下落モデルのスコア推移とメカニズム
Gemini 3.1 Proは初日の100点から最終日の94.45点に下落し、トレンド-5.6、平均83.9、変動27.3。GPT-o3は97.75点から96.1点に下落し、トレンド-1.7、平均87.6、変動18.5。GLM-4.6は77.6点から74点に下落し、トレンド-3.6、平均59.7、変動38。
Gemini 3.1 Proは初日に満点を記録した後、継続的に下落しており、資料制約の次元で複数回の減点が発生したことを示している。GPT-o3の平均87.6は上昇モデルの大半を上回っているが、トレンドは負であり、実行次元の安定性が小幅な下落を補うには不十分であることを示す。GLM-4.6の平均はわずか59.7と全モデル中最低であり、誠実性評価で複数回の警告が発生したこととあわせて、資料制約と誠実性の両次元が総合スコアを押し下げていることが分かる。
高変動モデルの原因分析
Claude Sonnet 4.6の変動は39.4、Gemini 2.5 Proは37.2、Claude Opus 4.7は38、Qwen3 Maxは36.8、GLM-4.6は38である。これらのモデルの安定性スコアはいずれも35点を下回っており、同種の問題に繰り返し回答した際のスコアの標準偏差が大きいことを意味する。
高変動の原因として最も考えられるのは、実行次元における問題ごとのパフォーマンスのばらつきである。Claudeシリーズのモデルは初日のスコアが低く、後半に大幅な回復を見せており、資料制約への対応が日付によって明確に異なることを示している。Qwen3 MaxとGemini 2.5 Proも同様に前半低・後半高のパターンを示しており、変動値は約37点で、コード実行環節のランダム性が高いことを反映している。
誠実性評価の変化が示す個別シグナル
DeepSeek V4 Proの誠実性評価はpass→warn→pass→pass→pass→warnという変動を示した。GLM-4.6も同様にpass→warn→pass→pass→warnという記録が残っている。誠実性評価は参入基準となるものであり、warn状態はエンジニアリング判断およびタスク表現のサイドランキングにおけるモデルの使用可否に直接影響する。
DeepSeek V4 Proの平均87.8は全モデル中でも上位に位置するが、誠実性評価が繰り返しwarnを記録しており、資料制約の環節において断続的な不一致行動が生じていることを示している。GLM-4.6は平均59.7かつ誠実性評価が複数回warnであり、メインランキングの2つの次元において系統的な問題があることを示している。
利用者への具体的な意味
コード実行を重視するチームはDeepSeek V4 Proを優先すべきである。平均87.8かつトレンド+10.5であり、実行次元のパフォーマンスが相対的に安定している。資料の忠実度に敏感なシナリオではGLM-4.6を避ける必要がある。平均59.7かつ誠実性評価が複数回warnとなっており、リスクが高い。
複数日にわたる安定した出力に依存する開発者はGPT-o3に注目すべきである。変動18.5は全モデル中最低であり、一貫性への要求が高い本番環境に適している。Claude Opus 4.7とQwen3 Maxの最終日スコアはすでに96点に近づいているが、変動が36点を超えており、非クリティカルなタスクでの試験的な使用に向いている。
戦略的判断
Gemini 3.1 Proの平均83.9は大半の上昇モデルを上回っているが、トレンド-5.6であり、その優位性が徐々に追い上げられていることを示している。Qwen3 MaxとClaude Opus 4.7のトレンド値はそれぞれ+36.8と+38に達しており、低ベースのモデルが実行および資料制約の両次元において明確な追い上げ余地を持っていることを示している。
GLM-4.6は平均59.7かつ誠実性評価が複数回warnであり、リスクが過小評価されている可能性が高いモデルである。GPT-5.5はトレンド+0.8でほぼ横ばい、平均82.3、変動28.5と中間的な位置にあり、基準参照として適している。
本週のデータは、2026年7月28日〜8月2日の7日間のスコアに基づく上記の判断のみを支持するものである。次回はDeepSeek V4 Proの誠実性評価が継続して安定するかどうか、およびQwen3 MaxとClaude Opus 4.7の高トレンドが持続するかどうかを検証する必要がある。
データ出典:YZ Index | Run #257 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接