2026年9月7日〜13日の期間において、Grok 4は初日80.13点から最終日87点へ上昇し、トレンド+6.9、均値85.8点、変動幅17.2を記録した。GLM-4.6は初日83.49点から最終日0点へ下落し、トレンド-83.5、均値20.7点、変動幅83.5となった。
上昇モデルのデータと分析
Grok 4は初日80.13点・最終日87点で、トレンド+6.9、均値85.8点、変動幅17.2。GPT-o3は初日77.5点・最終日85.15点で、トレンド+7.7、均値80.4点、変動幅32.2。Doubao Proは初日80.85点・最終日85.15点で、トレンド+4.3、均値86.3点、変動幅20.9。Claude Opus 4.7は初日61.25点・最終日63.59点で、トレンド+2.3、均値71.4点、変動幅23.5。Qwen3 Maxは初日55.99点・最終日57.65点で、トレンド+1.7、均値66.5点、変動幅30.5。
上昇モデルのうち、Grok 4とGPT-o3はトレンド増加幅が6点を超えており、均値はDoubao Proが最も高い。変動幅が21未満のGrok 4とDoubao Proは回答の一貫性が高いことを示している。GPT-o3の変動幅は32.2でGrok 4を上回り、日別スコアの振れ幅が大きいことを示している。
下降モデルのデータと分析
DeepSeek V4 Proは初日83.49点・最終日77.34点で、トレンド-6.1、均値77.9点、変動幅23。Gemini 3.1 Proは初日83.49点・最終日73.25点で、トレンド-10.2、均値77.3点、変動幅39.4。GLM-4.6は初日83.49点・最終日0点で、トレンド-83.5、均値20.7点、変動幅83.5。GPT-5.5は初日72.03点・最終日60.87点で、トレンド-11.2、均値75.9点、変動幅34.4。Gemini 2.5 Proは初日71.16点・最終日59.5点で、トレンド-11.7、均値74.4点、変動幅29.3。Claude Sonnet 4.6は初日65.24点・最終日53.56点で、トレンド-11.7、均値73.1点、変動幅32.7。
下降モデルのうち、GLM-4.6の変動幅83.5は他モデルを大きく上回り、Gemini 3.1 Proの変動幅39.4が次点となった。GLM-4.6は最終日にスコアが完全にゼロとなり、誠実性評価がwarnから始まりその後空白が続いていることとも相まって、回答の一貫性が極めて低いことが示されている。Gemini 3.1 ProとGPT-5.5はいずれも変動幅が34を超え、トレンド下落幅も10点以上に達した。
誠実性評価の個別分析
GLM-4.6の誠実性評価はwarn→warn→空白と推移し、pass以外の状態が連続して出現しており、変動幅83.5と直接対応している。Grok 4の誠実性評価はpass→warn→warn→pass→pass→pass→passと推移し、中間の2日間でwarnが出た後にpassへ回復しており、変動幅はわずか17.2で大多数の下降モデルを下回った。誠実性評価がwarnを示す時期とスコア変動の拡大には相関が見られ、GLM-4.6の空白記録はその回答の不安定性をさらに裏付けている。
ユーザーへのシナリオ別示唆
コード実行を重視するチームには、Grok 4が均値85.8点・変動幅17.2で主力モデルとして適している。GPT-o3は均値80.4点だが変動幅32.2であり、日別変動への備えとして代替案を用意しておく必要がある。素材制約に敏感なシナリオでは、均値86.3点で最も高いDoubao Proを優先して検討できる。GLM-4.6は均値わずか20.7点かつ最終日0点であり、安定した出力に依存する開発者にとって直接的なリスクとなる。
エンジニアリング判断サイドランキングでは、変動幅が30を超えるモデルは7日間連続テストにおいてスコア差が顕著であり、Gemini 3.1 Proの変動幅39.4・GPT-5.5の変動幅34.4はいずれも上昇モデルの平均水準を上回った。タスク表現サイドランキングでは、誠実性評価がwarnのモデルについては出力に追加の人的確認が必要である。
戦略的判断
2026年第37週のデータに基づくと、Grok 4とDoubao Proの「低変動・高均値」の組み合わせは現サンプルにおいて際立った成績を示している。GLM-4.6は高変動と誠実性の問題により、過小評価リスクが最も高い。Gemini 3.1 Proは初日こそDeepSeek V4 Proと同じ83.49点だったが、最終日は3.91点低く、一貫性の不足が明らかになった。次回期間ではGrok 4がトレンド+6.9以上の増加幅を維持できるか、またGLM-4.6の空白記録が続くかどうかを検証する必要がある。
Claude Opus 4.7はトレンド+2.3ながら均値71.4点で、安定性への要求が中程度のシナリオに適している。Qwen3 Maxはトレンド+1.7・均値66.5点・変動幅30.5であり、上位モデルとの20点差を縮められるかどうかを引き続き観察する必要がある。すべての判断は初日・最終日のスコア、トレンド値、均値、変動幅データに直接基づいている。
データソース:YZ Index | Run #320 | 原データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接