2026年9月21日〜9月27日のSmoke評価データによると、Claude Opus 4.7は7日間で70.77点から96.01点へ上昇し、トレンドは25.2、平均値87.8は全モデル中最高となった。
上昇傾向モデルの分析
Claude Opus 4.7は初日70.77点・最終日96.01点、トレンド25.2、平均値87.8、変動幅26。同モデルは7日間にわたりスコアが継続的に上昇し、最終日にはGPT-o3と並んで96.01点を記録した。GPT-o3は初日81.44点・最終日96.01点、トレンド14.6、平均値84.3。Qwen3 Maxは初日72.25点・最終日86.44点、トレンド14.2、平均値76.3。GPT-5.5は初日76.44点・最終日78.8点、トレンド2.4、平均値83.1。Grok 4は初日95.44点・最終日97.66点、トレンド2.2、平均値82.7。
これらの上昇トレンドは、コード実行と資料制約という2つの主要評価軸における安定した向上に起因している可能性が高い。Claude Opus 4.7の平均値が最も高いことは、10問連続の速度テストにおいて、実行精度と情報一貫性が高い水準を維持していることを示している。
モデル選定中の企業にとって、Claude Opus 4.7はコード実行を重視し、かつ高い資料忠実度が求められるシナリオに適している。同モデルに依存する開発者は、複数日にわたる安定した出力が必要なワークフローへの優先活用を検討するとよい。
戦略的評価:Claude Opus 4.7の平均値87.8は他の上昇モデルを明確に上回っており、現時点のデータは同モデルが過小評価されているとの結論を支持する。
明確な下落傾向モデルの分析
Gemini 3.1 Proは初日95.19点・最終日68.26点、トレンド-26.9、平均値80.2、変動幅26.9。DeepSeek V4 Proは初日95.01点・最終日69.31点、トレンド-25.7、平均値76.2、変動幅29。Gemini 2.5 Proは初日85.63点・最終日69.91点、トレンド-15.7、平均値78.5、変動幅27.4。Doubao Proは初日90.62点・最終日83点、トレンド-7.6、平均値84.3、変動幅19.4。
下落は資料制約評価軸のスコア低下によって引き起こされている可能性が高い。Gemini 3.1 Proは初日はまだ高い水準にあったが、最終日には68.26点まで下落し、7日間を通じて継続的に低下したことで、資料制約能力に体系的な後退が生じていることが示された。
資料忠実度への感度が高いシナリオにおいて、Gemini 3.1 Proを多用するチームはリスクの再評価が必要である。同モデルに依存する開発者は、出力品質の変動が業務に影響を与えないよう、代替手段の準備を進めるべきだ。
戦略的評価:Gemini 3.1 ProとDeepSeek V4 Proはともにトレンドが-25を下回っており、現時点のデータは両モデルが過大評価されているとの結論を支持する。
高変動モデルへの注目
Zhipu GLM-4.6は初日0点・最終日57.01点、トレンド57、平均値31.1、変動幅73.9。Claude Sonnet 4.6は初日72.5点・最終日92.19点、トレンド19.7、平均値79.8、変動幅45.1。Grok 4の変動幅は36.4、Qwen3 Maxは31.1。
高い変動幅はモデルの回答一貫性の低さを直接反映している。Zhipu GLM-4.6の標準偏差による安定性スコアは31.7点にとどまり、同種の問題に対する回答スコアのばらつきが非常に大きい。Claude Sonnet 4.6の変動幅45.1も、コード実行と資料制約評価軸のスコアが大きく上下していることを示している。
安定した出力を必要とする企業において、コード実行を重視するチームはZhipu GLM-4.6を本番環境で使用することを避けるべきである。同モデルに依存する開発者は、単日スコアの急激な変化に対応するため、人手によるチェック工程を追加する必要がある。
戦略的評価:Zhipu GLM-4.6とClaude Sonnet 4.6の変動幅は他のモデルを大きく上回っており、現時点のデータは両モデルの一貫性不足という結論を支持する。次期評価では標準偏差を低減できるかどうかの検証が必要だ。
誠実性評価の変化シグナル
Grok 4の誠実性評価はwarnからpassへ転換後、安定を維持している。Zhipu GLM-4.6の誠実性評価はwarnが出た後にpassへ回復したが、その間に空白記録が存在する。
誠実性評価は参入基準となるものであり、Grok 4がwarnからpassへ転換したことは、誠実性に関する回答の改善を示している。Zhipu GLM-4.6の評価が繰り返し変動していることは、初期段階で資料引用の不規範リスクが存在した可能性を示唆している。
モデル選定企業にとって、誠実性評価が安定しているモデルを優先することでコンプライアンスリスクを低減できる。Zhipu GLM-4.6に依存する開発者は出力ソースの追加確認が必要である。
戦略的評価:Grok 4の誠実性評価の改善はスコア上昇と同期しており、現時点のデータは同モデルの総合的な信頼性向上という結論を支持する。
7日間のデータを総合すると、Claude Opus 4.7は平均値・トレンドともに最優秀、Gemini 3.1 ProとDeepSeek V4 Proは最大の下落幅、Zhipu GLM-4.6とClaude Sonnet 4.6は最も激しい変動を示し、誠実性評価の変化はGrok 4とZhipu GLM-4.6の2モデルにのみ見られた。
データソース:YZ Index | Run #340 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接