DeepSeek V4 Pro、材料制約スコアが31.8点急落——コード実行は69.5から100点に急上昇

DeepSeek V4 Proは本日のSmoke評価において、材料制約ディメンションのスコアが昨日の100.00点から68.20点へと31.8点低下した。一方、コード実行ディメンションは69.50点から100.00点へと30.5点上昇した。

データの実態:メインランキングの微増が次元間の激震を覆い隠す

メインランキングのスコアは83.23点から85.69点へと2.46点増加した。エンジニアリング判断は100.00点から94.50点へ、タスク表現は100.00点から94.70点へそれぞれ低下した。誠実性評価は「pass」を維持している。

Smoke評価は1日あたり各ディメンション2問のみで、1日のサンプル数は極めて少ない。材料制約とコード実行の2項目でほぼ対称的な30点規模の逆方向の変動が見られたことは、モデル能力の構造的劣化ではなく、問題抽選のランダム性を示唆している。

原因分析:サンプリングの揺らぎであり、真の劣化ではない

材料制約は昨日満点、本日68.20点で差は31.8点。コード実行は昨日69.50点、本日100.00点で差は30.5点。両ディメンションの変動幅がほぼ等しく方向が逆である点から、最も可能性の高い説明は、当日抽出された材料制約の2問の難易度または制約要件が昨日より著しく高く、コード実行の問題は比較的易しかったというものだ。

エンジニアリング判断とタスク表現はそれぞれ5.5点・5.3点の低下にとどまり、主要ディメンションと比べ変動幅が小さく、小サンプルのノイズ特性と一致している。モデルに材料忠実度の系統的な劣化が生じている場合、通常はコード実行スコアも同時に低下するはずであり、30.5点の相殺的な上昇が見られることはない。

利用者への示唆

材料引用に強く依存する企業や開発者にとって、本日の68.20点は、原文テキストへの厳密な忠実性が求められる場面において、1回の呼び出しで失敗する確率が明確に上昇することを意味する。人手による再確認や複数ラウンドの検証ステップを追加する必要がある。

コード実行を主軸とするチームはより高い確実性を得られる。本日の100.00点は、このモデルがアルゴリズム実装やデバッグタスクにおいて満点水準に達していることを示しており、コード生成パイプラインへの優先採用を検討する価値がある。

戦略的判断

1日での31.8点の材料制約スコア低下はSmoke評価における通常の変動範囲内であり、即座に評価を引き下げる根拠にはならない。メインランキングは依然としてプラス成長を達成しており、コード実行の満点貢献が材料制約の損失を完全に補填していることを示している。

次回の材料制約スコアが引き続き70点以下に留まり、かつコード実行が高水準を維持する場合は、プロンプトテンプレートまたはシステム指示レベルでの材料処理メカニズムに変化が生じているかどうかを検証する必要がある。現時点のデータは「サンプリングに起因する」という結論のみを支持しており、「モデルの劣化」という判断は支持しない。


データ出典:YZ Index | Run #248 | 生データを見る