2026年9月14日から9月20日の期間において、Claude Opus 4.7は初日の91.09点から最終日の96.99点へと上昇し、トレンド値は+5.9、平均スコアは87.9点となった。
上昇モデルのスコア推移とメカニズム
Qwen3 Maxは今週トレンド+19.1を記録し、70.47点から89.52点へと上昇した。平均スコアは75.3点、変動幅は34.9。同モデルは7日間の連続テストで明確な上昇傾向を示し、最終日のスコアはClaude Sonnet 4.6と同じ89.52点に並んだ。Claude Sonnet 4.6はトレンド+7、82.5点から89.52点へ上昇し、平均85.6点、変動幅23.6。Doubao Proはトレンド+3.3、91.09点から94.35点へ上昇し、平均83.5点、変動幅24.2。
これらの上昇は主に、コード実行と資料制約という2つのメインランキング評価軸に現れている。Qwen3 Maxは初日に低スコアを記録した後、徐々に安定し、最終日のスコアはClaude Opus 4.7の水準に近づいた。これは、Smoke 10問の簡易テストにおける実行系タスクへの応答一貫性が改善されたことを示している。
下降モデルのスコア推移とメカニズム
DeepSeek V4 Proはトレンド-15.3、91.09点から75.77点へ下落し、平均66.6点、変動幅43.3で今週最大の変動値を記録した。Gemini 3.1 Proはトレンド-11.6、87点から75.38点へ下落し、平均71.2点、変動幅28.1。Grok 4はトレンド-11.2、86.61点から75.38点へ下落し、平均81点、変動幅23.3。GPT-5.5はトレンド-4.6、91.09点から86.5点へ下落し、平均84.3点、変動幅17.1。Gemini 2.5 Proはトレンド-3、70.19点から67.24点へ下落し、平均77.3点、変動幅36.6。
DeepSeek V4 ProとGemini 2.5 Proはいずれも変動幅が36を超えており、7日間で同種の問題に対する回答にが著しく生じたことを示している。Zhipu GLM-4.6は全期間を通じて0点、トレンド0、平均0、変動幅0であり、有効スコア範囲には到達しなかった。
誠実性評価変化の個別分析
Doubao Proの誠実性評価は5日目にwarnが発生し、残りの6日はpassとなった。Grok 4は6日目にwarnが発生し、残りはpassだった。Qwen3 Maxは初日と6日目にwarnが発生し、残りはpassだった。3モデルのwarnはいずれも連続して発生していないが、Qwen3 MaxとDoubao ProのwarnはスコアRの変動が大きい日と重なっており、誠実性評価のwarnと回答一貫性の低下に相関関係があることを示唆している。
高変動モデルの原因分析
DeepSeek V4 Proの変動幅43.3、Qwen3 Maxの34.9、Claude Opus 4.7の33.2、Gemini 2.5 Proの36.6は、いずれも他のモデルを上回っている。Smokeは1日あたり10問のみでサンプル数は少ないが、7日間の連続データにより、これらのモデルがコード実行と資料制約の評価軸においてスコアの標準偏差が大きいことが示された。安定性の計算式max(0,100-stddev×2)の下では、高変動は安定性スコアを直接引き下げ、回答一貫性の不足を反映する。
利用者への具体的な意味
コード実行を重視するチームがDeepSeek V4 Proに依存する場合、平均66.6点と変動幅43.3は日次タスク結果の差異が30点以上生じる可能性を意味し、人手による検証プロセスの追加が必要となる。資料への忠実性が重視される場面では、Claude Opus 4.7の最終日96.99点と平均87.9点の組み合わせがより参考価値を持つが、変動幅33.2があるため、重要なアウトプット前には複数回の検証を開発者に求める。
誠実性評価でwarnが発生したDoubao ProとQwen3 Maxについては、開発者が本番環境に追加のファクトチェックステップを設け、warn発生時の低一貫性な出力が下流システムに流入しないようにすべきである。
戦略的判断
今週のデータに基づくと、Qwen3 MaxとClaude Sonnet 4.6のトレンド値はそれぞれ+19.1と+7であり、最終日のスコアが高位域に達しており、平均値と比較して過小評価されている可能性がある。DeepSeek V4 ProとGemini 3.1 Proはいずれも負のトレンド値が-11を超え、変動幅も上位に位置しており、現在のスコアが過大評価されている可能性を示している。Zhipu GLM-4.6の0点記録は、今回のSmokeテストで有効な出力が得られなかったことを示しており、次回の評価で回復するかどうか確認が必要である。
誠実性評価のwarnシグナルが3モデルで確認されたことは、モデル選定を行う企業が誠実性評価を参入基準として設け、warn頻度が高いモデルを優先的に除外すべきであることを示唆している。すべての判断は2026年第38週の7日間のスコア・トレンド・変動データに直接基づいており、データの支持範囲を超えていない。
データ出典:YZ Index | Run #330 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接