Qwen3 Maxは本日のSmokeテストにおいて、コード実行スコアが96.70点から75.00点へと低下し、素材制約スコアは48.80点から69.20点へと上昇した。主要ランキングスコアは75.15点から72.39点へと低下した。
データファクト:各次元スコアの比較
コード実行次元では−21.7点の変化が生じ、素材制約次元では+20.4点の変化が生じた。エンジニアリング判断は36.10点から47.20点へと上昇し、タスク表現は60.00点から41.70点へと低下した。誠実性評価は「pass」から「warn」に転じた。主要ランキングスコアの低下はわずか2.8点にとどまった。
原因分析:抽選による変動か、真の性能低下か
Smokeテストは1日わずか10問、各次元2問であり、サンプル数は極めて少ない。コード実行とタスク表現が同時に大幅下落し、素材制約とエンジニアリング判断が同時に上昇したことは、出題抽選による難易度分布の変化が主な要因であることを示している。主要ランキングスコアの低下がわずか2.8点にとどまったことは、二つのコア次元の反対方向の変動が互いに相殺し合い、一貫した性能低下のシグナルにはまだ至っていないことを示している。
誠実性評価が「warn」に転じたことは、今回の変化の中で唯一追加の注視を要する点である。この評価はモデルの利用資格に直接影響するものであり、そのトリガーメカニズムはコード実行とタスク表現の低スコアと直接関連しているが、現時点ではまだ「warn」にとどまり「fail」には達していない。
利用者への意味合い
コード実行場面への依存度が高いチームは、本日以降、手動での再確認プロセスを追加する必要がある。コード実行75.00点はすでに素材制約69.20点を下回っており、正確な計算や構造化された出力を必要とするタスクにおけるモデルの安定性が低下していることを意味する。素材制約69.20点の向上は、入力制約を厳密に遵守する必要がある場面に対してはプラスの影響をもたらす。
エンジニアリング判断47.20点とタスク表現41.70点のスコア差は、モデルがエンジニアリング意思決定系の問題において、オープンエンドな表現タスクと比較して相対的に優れた性能を発揮していることを示している。タスク表現に依存する開発者は、Qwen3 Maxへの期待を一時的に引き下げることが望ましい。
戦略的判断
今回の変化は、モデルの能力低下ではなく、出題抽選による変動に起因する可能性が最も高い。主要ランキングスコアのわずか2.8点の低下と二つのコア次元の反対方向の変動は、小サンプルの迅速テストにおける通常の範囲に合致している。誠実性評価の「warn」は、次回のテストで検証すべき唯一のシグナルであり、次回テストでもコード実行とタスク表現が引き続き低水準にとどまる場合には、モデルの真の一貫性の問題を検討する必要がある。
現在のデータは、Qwen3 Maxを過大評価または過小評価と判定することを支持しておらず、単日の変動が誠実性の閾値に触れたことを示唆するにとどまる。次回のSmokeテストでは、コード実行と誠実性評価の二指標の回復状況を重点的に観察することを推奨する。
データ出典:YZ Index | Run #309 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接