2026年8月24日〜8月30日のSmoke評価において、Claude Opus 4.7は初日の82.98点から最終日の93.08点へと上昇し、トレンドは10.1点のプラスとなった。
上昇モデルのデータとメカニズム
Claude Opus 4.7は今週のトレンドが+10.1点、最終日スコア93.08点、平均86.5点、変動幅27.5点。Claude Sonnet 4.6はトレンド+12.1点、58.23点から70.33点へ上昇、平均79点、変動幅32.6点。DeepSeek V4 Proはトレンド+7.6点、80.46点から88.08点へ上昇、平均70.7点、変動幅39.1点。Qwen3 Maxはトレンド+8.3点、71.73点から80.07点へ上昇、平均80.6点、変動幅21.8点。Grok 4はトレンド+1.1点、87.09点から88.14点へ上昇、平均90点、変動幅13.6点。
これらの上昇は主に、複数日にわたるコード実行ディメンションのスコア向上と関連している。Claude Opus 4.7は素材制約ディメンションを安定的に維持しつつ、実行ディメンションで標準解答との偏差を徐々に縮小し、最終日スコアの押し上げにつながった。Grok 4の変動幅はわずか13.6点にとどまり、実行・制約の両メインランキングディメンションで高い出力一貫性を示している。
下降モデルのデータとメカニズム
Gemini 3.1 Proはトレンド-11.2点、初日の96.98点から最終日85.83点へ下落、平均83.7点、変動幅33.4点。Gemini 2.5 Proはトレンド-6.4点、92.16点から85.73点へ下落、平均88.2点、変動幅21.1点。GPT-o3はトレンド-13.7点、83.23点から69.56点へ下落、平均87.1点、変動幅30.4点。GPT-5.5はトレンド-1.6点、64.66点から63.08点へ下落、平均76.8点、変動幅33.5点。
Gemini 3.1 ProとGPT-o3の下降は、実行ディメンションのスコア変動拡大を伴っている。Gemini 3.1 Proは初日に高得点を記録した後、素材制約での減点が連続して発生し、最終日スコアが11.2点直接押し下げられた。GPT-o3は平均87.1点であるにもかかわらず最終日は69.56点にとどまり、継続テストにおいてエンジニアリング判断サイドランキングのスコアが不安定であることを示している。
横ばいモデルと高変動シグナル
GLM-4.6はトレンド+1点、87.54点から88.58点、平均71.3点、変動幅43.6点。Doubao Proはトレンド-0.7点、86.54点から85.89点、平均87.1点、変動幅9.7点。
GLM-4.6の変動幅43.6点は全モデル中最大であり、実行ディメンションと素材制約ディメンションのスコア標準偏差が大きく、安定性が低い。Doubao Proの変動幅はわずか9.7点で、出力一貫性が最も優れている。
誠実性評価の変化分析
GLM-4.6とDoubao Proは初日の誠実性評価が「warn」であったが、その後6日間は「pass」に転じた。Grok 4は5日目に1回「warn」が出た以外はすべて「pass」であった。「warn」から「pass」へ転じたモデルは、今週の素材制約ディメンションにおける減点が顕著に減少しており、モデル出力での事実的な偏差が減っていることを示している。
ユーザーへの具体的な示唆
コード実行を重視するチームはGrok 4を優先的に選択できる。平均90点かつ変動幅13.6点であり、安定した出力が求められる場面に適している。素材への忠実度を重視する場面では、Doubao Proは変動幅9.7点かつ誠実性評価が「pass」へ転じており、長文テキスト生成タスクに適している。Claude Opus 4.7の最終日スコアは93.08点であり、エンジニアリング判断サイドランキングの高得点を必要とするプロトタイプ開発に適している。
Gemini 3.1 Proに依存する開発者はトレンド-11.2点に注意が必要であり、継続テストにおける実行ディメンションの変動がデプロイ後の一貫性低下につながる可能性がある。GPT-o3は平均87.1点であるが最終日は69.56点にとどまっており、安定性が求められる本番環境では追加検証が必要である。
戦略的判断
今週のデータに基づくと、Claude Opus 4.7とClaude Sonnet 4.6はトレンドが明確に上昇しており、平均スコアと最終日スコアが同時に向上していることから、次期もメインランキングディメンションの動向を継続観察する価値がある。Gemini 3.1 ProとGPT-o3はトレンドが下降し変動幅も30点超であり、Smoke速評における一貫性の低下を示すシグナルが出ている。GLM-4.6は高変動幅43.6点と誠実性評価の改善が並存しており、実行ディメンションが安定ゾーンに入ったかどうかの検証が必要である。Grok 4は平均90点かつ変動幅が最小であり、現時点のデータはメインランキング両ディメンションにおいて過小評価されている可能性を示している。
データソース:YZ Index | Run #300 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接