Qwen3 Max、コード実行スコアが24点急落——メインランキングも7.4点下落

本日のSmoke評価テストにおいて、Qwen3 Maxのコード実行スコアは94.00点から70.00点へと急落し、メインランキングスコアも84.51点から77.16点に低下した。

スコア変化の詳細

コード実行の次元で-24点という大幅な落ち込みが見られた一方、素材制約の次元は72.90点から85.90点へと13点上昇した。エンジニアリング判断は11.30点から36.80点、タスク表現は63.90点から75.60点にそれぞれ上昇した。誠実性評価はpassを維持している。

メインランキングの構成と変動要因

メインランキングはコード実行と素材制約の2次元のみを加重して算出される。コード実行の-24点がメインランキングを直接7.4点押し下げた一方、素材制約の+13点がその影響を部分的に相殺した。エンジニアリング判断とタスク表現はサブランキングに属し、AI補助評価として実施されるものであり、メインランキングには算入されない。

考えられる原因の分析

Smoke評価テストは1日あたり10問、各次元2問という少ないサンプル数で実施されるため、問題の抽選による変動が最も有力な要因として考えられる。コード実行問題の難易度や問題タイプの変化がスコアの大幅な変動を引き起こした可能性があり、モデル能力自体に系統的な劣化が生じたとは言い切れない。素材制約スコアが上昇していることは、制約遵守の面ではモデルが同時に弱体化していないことを示している。

仮に真の劣化であれば、コード実行と素材制約は通常同じ方向に変化するはずだが、今回は両次元が逆方向の動きを示しており、これは変動による説明を支持する。エンジニアリング判断とタスク表現の上昇も、全体的な能力低下のシグナルを示してはいない。

利用者への示唆

コード実行を重視するチームは、Qwen3 MaxのSmoke評価テストにおけるコード実行スコアが70.00点まで低下しており、1日の実績が従来の94.00点水準を下回る可能性があることに留意する必要がある。素材の忠実度を重視するシナリオでは、新高値となった85.90点を参考指標として活用できる。

開発者がモデルを選定する際は、コード実行70.00点と素材制約85.90点の両方を考慮に入れ、メインランキングの77.16点だけを根拠に判断することは避けるべきだ。

戦略的判断

今回のコード実行-24点は、モデルの真の劣化よりも問題の抽選による変動に起因する可能性が高い。メインランキング77.16点は依然として実用範囲内にあるが、次回以降のデータで一貫性を検証する必要がある。エンジニアリング判断36.80点とタスク表現75.60点の上昇は、メインランキングの核心的な結論を変えるものではない。

今後複数回にわたってコード実行スコアが継続的に80点を下回るようであれば、コード集約型シナリオにおける適用性を改めて評価する必要がある。現時点のデータは変動への注視を支持するにとどまり、能力の劣化と断定する根拠とはならない。


データ出典:YZ Index | Run #354 | 元データを見る