DeepSeek V4 Pro、コード実行スコアが25点急落――総合スコアも6.7点下落

DeepSeek V4 ProはSmokeテストにおいて、コード実行スコアが前日の100.00から75.00へ低下し、総合スコアも83.53から76.85へと下落した。

スコアの事実と各次元の内訳

総合スコアはコード実行と資料制約の加重平均のみで構成される。本日のコード実行は75.00、資料制約は79.10であり、両者の平均から総合スコア76.85が算出された。コード実行は1日で25点下落した一方、資料制約は15.7点上昇した。エンジニアリング判断は70.80から100.00へ上昇し、タスク表現は91.70から74.20へ低下、誠実性評価はwarnからpassへと改善した。

変動要因の分析

Smokeテストは1日10問、1次元あたり2問という構成であり、サンプルサイズが小さいため1日あたりの標準偏差が本質的に高くなりやすい。コード実行の急落は、本日抽出された2問が関数呼び出し・境界条件・多段階推論に対してより高い要求を課すものであったのに対し、前日の問題が比較的平易であったことに起因する可能性が最も高い。資料制約の上昇は、本日の問題においてモデルが与えられた資料への忠実度を改善したことを示している。エンジニアリング判断とタスク表現はいずれもサイドスコア(AI支援評価)に属しており、その大幅な変動も極めて小さいサンプルに起因するものであり、モデルの能力における構造的変化を直接推論することはできない。

コード実行 75.00 vs 前日 100.00、資料制約 79.10 vs 前日 63.40、総合スコア 76.85 vs 前日 83.53。

現時点のデータは「モデルの実質的な性能劣化」という結論を支持しない。資料制約とエンジニアリング判断が同時に明確な正方向の変動を示しており、モデル全体の出力品質が系統的に低下したわけではないことが確認できる。問題の抽選によるばらつきである可能性の方がはるかに高い。

利用者への具体的な意味

コード実行に強く依存するチーム(自動テストケース生成やデータ処理スクリプトを扱う開発者など)は、本日以降、1日単位の変動による潜在的なエラーの混入を避けるため、人手によるレビュー工程を追加することが望ましい。資料制約スコア79.10は、所定のドキュメントやAPI仕様への厳密な準拠が求められるシナリオにおいて、モデルが概ね良好なパフォーマンスを発揮していることを示しており、ドキュメントQ&Aタスクへの継続利用は問題ない。誠実性評価がpassに転じたことで、本番環境におけるコンプライアンス上の参入障壁が低下した。

戦略的判断

現行のスコア比較に基づくと、DeepSeek V4 Proの総合スコア下落はコード実行という単一次元の変動によるものであり、全次元の劣化ではない。次回の評価でコード実行が引き続き80点を下回る場合は注視の優先度を引き上げる必要があるが、90点以上に回復した場合は本日の結果が典型的な抽選ノイズであったと判断できる。現時点のデータが支持する結論は「継続的な観察」のみであり、モデルの優先度を引き下げる判断を支持するものではない。


データ出典:YZ Index | Run #254 | 生データを見る