Qwen3 Maxの総合スコアが8.4点急落——材料制約スコアは1日で16.5点下落

Qwen3 Maxは本日のSmokeベンチマークにおいて、総合スコアが前日の95.34点から86.98点へ下落し、8.4点の減少を記録した。

スコア詳細比較

コード実行スコアは97.00点から95.30点へ1.7点下落。材料制約スコアは93.30点から76.80点へ16.5点下落。エンジニアリング判断サブスコアは63.90点から36.10点へ27.8点下落。タスク表現サブスコアは70.60点から30.00点へ40.6点下落。誠実性評価はpassを維持。

データファクト分析

総合スコアはコード実行と材料制約の2項目のみで加重構成されている。本日の総合スコア8.4点の下落は、そのほとんどを材料制約が占めている。コード実行はわずかな下落にとどまり、モデルがコード生成・実行においては依然として高い水準を維持していることを示す。材料制約の大幅な下落が総合スコアの平均値を直接押し下げた。

原因分析

Smokeベンチマークは1日10問のみで、各項目2問と出題数が極めて少なく、問題の抽選による変動が最も考えられる主な要因である。材料制約スコアは本日、指示遵守とコンテキストへの忠実度の要求が非常に高い問題が出題された可能性があり、これにより93.30点から76.80点への急落を招いたと考えられる。エンジニアリング判断とタスク表現のサブスコアがさらに大きく下落していることも、当日の問題が複雑な制約下でのモデルの不安定な出力を集中的に露呈させた可能性を裏付けている。

もう一つの可能性として、材料制約シナリオにおけるモデルの実際の能力変動が挙げられる。1日で16.5点という下落幅は通常の抽選変動の範囲をはるかに超えており、Qwen3 Maxが長いコンテキストの材料を処理する際に指示の無視やコンテンツの改変が生じる確率が上昇している可能性を示唆している。

利用者への影響

材料制約に強く依存するシナリオ——例えば契約書レビュー、レポート生成、ナレッジベース問答——では、本日のデータからQwen3 Maxの出力信頼性が明らかに低下していることが示されている。原文への厳密な忠実さが求められるタスクにモデルを使用する開発者は、人手による校正プロセスを追加する必要がある。

コード実行タスクへの影響は比較的小さく、コード生成・デバッグに依存するチームは引き続き利用可能だが、材料制約に関わる二次処理環節には注意を払う必要がある。

戦略的判断

本日のデータに基づくと、Qwen3 Maxは材料制約スコアにおいて注目すべき異常変動が生じている。1日で16.5点の下落とサブスコア40.6点の下落は、単なる問題の運不運ではなく、制約遵守における一貫性の不足を示している。次回のベンチマークでは材料制約スコアが90点以上に回復するかどうかを重点的に観察する必要があり、低水準が続く場合は材料に敏感なシナリオでの優先度を引き下げる必要がある。

現時点での判断は「要注意」だが、全面的な性能劣化には至っていない。コード実行スコアは依然95.30点を維持しており、コア能力は崩壊していないことを示す。企業が採用を検討する際は、Qwen3 Maxと材料制約スコアがより安定したモデルを並行テストし、単一モデルの変動がもたらすリスクを低減することを推奨する。


データ出典:YZ Index | Run #283 | 元データを見る