DeepSeek V4 Pro、材料制約スコアが18.4点急落——コード実行は逆に11.1点上昇

DeepSeek V4 Proは本日のSmokeテストにおいて、材料制約スコアが昨日の81.70点から63.30点へと直接下落し、降下幅は18.4点に達した。主要ランキングの総合スコアは82.64点から80.46点へと2.2点のみの下落となった。

スコア内訳と根拠データ

コード実行の次元では83.40点から94.50点へ11.1点上昇、エンジニアリング判断は75.00点から50.00点へ25点下落、タスク表現は75.00点から66.70点へ8.3点下落した。誠実性評価は「pass」を維持した。以上のデータはすべて、1日10問・各次元2問のSmokeクイックテスト(同一回)から得られたものである。

変動要因の分析

Smokeテストでは1日あたり材料制約次元をカバーする問題が2問のみであり、1問誤答するだけでその次元のスコアが20〜30点低下する。材料制約スコアの急落は、当日抽出された2問がソースへの忠実度に対する要求がより高い問題であり、モデルが一度明確なハルシネーションや過度な書き換えを起こした可能性が最も高い。コード実行スコアが同時に11.1点上昇していることは、モデル全体の推論能力に系統的な劣化が生じておらず、むしろ特定の制約タスクにおける抽出問題のランダム変動であることを示している。

エンジニアリング判断の25点下落も、モデルのパラメータ変更ではなく問題難易度の抽選による差異を示している。主要ランキングが2.2点の小幅下落にとどまったのは、コード実行と材料制約の両項目が相殺された結果であり、小サンプルのクイックテストにおいて単一次元が激しく変動することは通常の統計的現象であることを証明している。

利用者への具体的な意味

材料制約に強く依存するRAGシステムや企業ナレッジベースのチームは、本日DeepSeek V4 Proの出力に対して追加の人的検証を行う必要がある。特に原文引用や詳細の作り込み防止が求められるシナリオでは注意が必要だ。コード実行スコアの上昇は、このモデルがアルゴリズム実装やデータ処理スクリプト生成タスクでより安定したパフォーマンスを発揮していることを示している。

エンジニアリング判断も同時に必要とする開発者にとって、本日の50.00点という結果は、アーキテクチャレビューや方針選択に関するプロンプト下でモデル出力の一貫性が低下していることを示唆しており、一時的に他のモデルへ切り替えるか、多段階確認ステップを追加することを推奨する。

戦略的判断

現在のスコア比較に基づくと、材料制約の18.4点下落は問題抽選の変動によるものであり、モデルの実際の性能劣化ではない可能性が最も高い。コード実行の逆方向上昇がこの判断をさらに支持している。1日分のデータではトレンドを確認するには不十分であり、次回のSmokeテストで材料制約が80点台に回復するかどうか引き続き観察することを推奨する。2日連続して低水準が続く場合には、本番環境での呼び出し戦略の調整を検討すべきだ。

現時点で主要ランキングの80.46点は依然として実用可能な範囲にあり、安定性要件が高くない軽量タスクでは引き続き使用可能だが、材料の忠実度に敏感なシナリオでは検証フローを追加する必要がある。


データソース:YZ Index | Run #292 | 生データを見る