Qwen3 Max、メインランキングで14.9点急落——コード実行スコアが96.9から65.6へ激減

Qwen3 MaxはSmoke評価テストの本日のメインランキングで82.23点から67.31点へと14.9点下落し、コード実行次元は96.90点から65.60点へと急落した。

スコア変化の内訳

コード実行次元は1日で31.3点下落。材料制約次元は64.30点から69.40点へ上昇。エンジニアリング判断(サイドランキング、AI補助評価)は36.30点から11.30点へ下落。タスク表現(サイドランキング、AI補助評価)は46.70点から48.90点へ上昇。誠実性評価はpassからwarnへ変化した。

原因の分析

Smoke評価テストは1日10問のみ、次元ごとに2問ずつであり、1日単位での抽選による変動は通常の範囲内といえる。しかしコード実行次元の31.3点という下落幅は典型的な変動範囲を大幅に超えており、エンジニアリング判断(サイドランキング、AI補助評価)も同時に25点下落していることから、複数ステップの推論とコード生成を必要とする問題においてモデルが系統的な失敗を起こしていることが示唆される。一方、材料制約次元は5.1点上昇しており、所定の材料を引用する際の基本的な忠実度は維持されていることを示している。問題はコード生成と論理チェーンの安定性に集中している。

誠実性評価がpassからwarnへ変化したことは、モデルが一部の問題において事実的な偏差または指示からの逸脱を起こしていることをさらに示しており、コード実行次元の急激な下落と符合する。現時点のデータでは、問題の抽選がたまたまモデルの弱点に当たったのか、それともモデルの実際の能力が低下しているのかを判別することはできない。しかし31.3点という単一次元の下落幅は、通常の抽選による説明の範囲をすでに超えている。

利用者への示唆

コード生成に強く依存している開発者チームは、Qwen3 Maxへの信頼度を直ちに引き下げる必要がある。コード実行次元が96.90点から65.60点へ下落したことは、これまでそのまま利用できていたコード出力が、今後は論理エラーや実行失敗が高い確率で発生するようになり、追加の人手によるレビューが必要になることを意味する。

材料への忠実度が重視されるRAGシナリオへの影響は比較的小さい。材料制約次元は依然として69.40点を維持しており、所定のテキストを引用する際のモデルのパフォーマンスは比較的安定している。コード実行とエンジニアリング判断を同時に必要とする複雑なタスクシナリオが最もリスクが高い。

戦略的判断

今回の14.9点のメインランキング下落は、コード実行とエンジニアリング判断の両次元が同時に大幅下落したことと直接関連しており、材料制約とタスク表現のわずかな変化ではコア能力の損失を補うことはできない。Qwen3 MaxのSmoke評価テストにおける一貫性には明確な問題が生じており、次回の評価においてコード実行次元が回復するかどうかを重点的に追跡することを推奨する。当該次元が80点を下回り続ける場合は、コード生成系タスクの主力モデルリストからの除外を検討する必要がある。

現時点のデータが支持する結論は以下の通りである:Qwen3 Maxの本日のパフォーマンスはすでに注意閾値を超えており、コード実行能力の異常な下落と誠実性評価の変化が合わさって明確なリスクシグナルを構成している。


データソース:YZ Index | Run #238 | 元データを見る