DeepSeek V4 Pro、材料制約スコアが1日で19.5点下落――総合ランキングも7.6点低下

DeepSeek V4 ProはSmokeベンチマークの本日の評価において、材料制約スコアが前日の89.50点から70.00点へと低下し、総合ランキングも94.07点から86.50点に下落した。

スコアの事実と各次元の内訳

コード実行は97.80点から100.00点へと上昇し、エンジニアリング判断は100.00点のまま変わらず、タスク表現は95.80点から95.00点へとわずかに低下、誠実性評価はpassを維持した。材料制約の19.5点という下落幅が、総合ランキングを直接7.6点押し下げた。

原因分析:サンプリングのばらつきかモデルの劣化か

Smokeベンチマークは1日あたり各次元につき2問のみであり、材料制約の急落はmost likely、出題された問題の難易度が上昇したことによるものと考えられる。コード実行が同時に満点を記録していることは、モデル全体の能力に系統的な劣化が生じていないことを示しており、今回の変動は単一次元のサンプリング差異に近い。

材料制約70.00点 vs 前日89.50点、差分−19.5点;コード実行100.00点 vs 前日97.80点、差分+2.2点。

真の劣化であれば、コード実行とエンジニアリング判断にも通常は同時に影響が出るが、現在のデータでは材料制約のみが異常を示しており、出題における原文への忠実度要求が突然高まったことを示唆している。

利用者への具体的な意味

材料制約を重視するシナリオ(法律契約の抽出や学術引用の確認など)では追加の人的確認が必要であり、1日70.00点という水準では出力が原文資料から乖離する可能性がある。コード実行が満点であるという結果は、コードデバッグを重視するチームにとって引き続き参考価値がある。

  • 材料制約に依存する開発者は、重要なタスクの前に複数回の検証を追加すべきである。
  • コード実行が安定しているユーザーは、プログラミング関連の作業に引き続きこのモデルを使用できる。

戦略的判断

材料制約の1日19.5点という変動はすでに通常のサンプリング範囲を超えており、次回の評価でこの次元が低水準を継続するかどうかを重点的に検証することを推奨する。現在のデータはモデル全体の劣化という結論を支持しないが、材料制約の不安定性はモデル選定チームが優先して注目すべき点である。


データ出典:YZ Index | Run #270 | 生データを見る