Qwen3 Max、材料制約スコアが20点急落し47.70点に——コード実行は37.8点急騰、メインランキングは11.8点上昇

Qwen3 Maxは本日のSmoke評価において、材料制約スコアが前日の67.70点から47.70点へ20点下落し、コード実行スコアは54.70点から92.50点へ37.8点上昇した。メインランキング総合スコアは60.55点から72.34点へ上昇した。

メインランキングスコアの内訳と直接比較

メインランキングはコード実行と材料制約の2つの次元の加重スコアのみで構成されている。本日のコード実行92.50点は前日の54.70点と比較し、材料制約47.70点は前日の67.70点と比較している。両者の加重合算により、メインランキングは正味11.8点上昇した。エンジニアリング判断は72.20点から55.60点へ下落し、タスク表現は31.70点から66.70点へ上昇したが、いずれもサイドランキングの次元であり、メインランキングには算入されない。

材料制約20点下落の考えられるメカニズム

Smoke評価では材料制約次元を1日わずか2問でカバーしている。1問あたりのスコア変動が、次元スコアの差として20点以上に直接影響する場合がある。本日の材料制約47.70点は2問の平均正答率約47.7%に相当し、前日の67.70点は約67.7%に相当する。出題のランダム性が主要な説明要因となる。本日の2問がいずれも原文の厳密な引用や複数段落の一貫性を要求する内容であった場合、モデルの出力のずれが減点を拡大させる。コード実行が同時に37.8点急騰していることも、モデル全体の能力の突発的変化ではなく、出題難易度分布の変化を示している。

コード実行92.50点と材料制約47.70点が同時に現れていることは、異なるタスク種別におけるモデルのパフォーマンス差が当日の出題によって増幅されたことを示している。

利用者へのシナリオ別示唆

法的契約の抽出、学術引用の照合、長文書のファクトチェックなど、資料への忠実性に強く依存するシナリオを担うチームは、本日の47.70点という結果を踏まえ、人手による再確認工程を追加する必要がある。コード生成とデバッグを主用途とする開発者は、92.50点水準の出力を引き続き活用できるが、資料引用部分の検証は依然として必要である。エンジニアリング判断のサイドランキング55.60点はシステムアーキテクチャ意思決定への参考価値が低下しており、タスク表現66.70点はプロンプト反復改善に一定の補助的価値を持つ。

安定性と真の性能劣化の区別

安定性次元は同種問題の複数回スコアの標準偏差を測定するが、本日の単日データからは標準偏差を算出できない。材料制約の単日-20点とコード実行の+37.8点の並存は、モデルのパラメータレベルの劣化ではなく、出題抽選による変動の特徴に合致している。誠実性評価はpassを維持しており、一貫性の問題や事実の捏造は発生していない。

戦略的判断

現在のスコア比較に基づくと、Qwen3 Maxのメインランキング上昇は主にコード実行という単一次元に牽引されており、材料制約の20点下落は2問のサンプルにおいて継続的な性能劣化のシグナルを構成しない。次回のSmoke評価で材料制約が引き続き55点を下回る場合は重点的な検証が必要となるが、65点以上に回復した場合は本日の結果が出題抽選の異常であったと確認される。現時点のデータは、モデル全体の能力を下方修正する結論を支持しない。

企業がモデルを選定する際は、材料制約スコアの連続3日間の標準偏差を同時に観察する必要がある。標準偏差が15点を超える場合、そのモデルは材料制約次元における一貫性が不十分であることを示し、コード補助ツールとしての利用には適しているが、中核的な知識業務の基盤としては適さない。開発者は材料制約の弱点に対して二次検証フローを設計し、47.70点水準における潜在リスクを低減することができる。


データ出典:YZ Index | Run #255 | 元データを見る