DeepSeek V4 Pro、コード実行スコアが41.7点急落——メインランキングで日次19.2点下落

DeepSeek V4 ProはSmoke評価の本日メインランキングで70.44点から51.24点へと19.2点下落した。主な要因は、コード実行ディメンションが66.70点から25.00点へと急落したことによる。

データ分解:単一ディメンションが下落を主導

コード実行ディメンションは1日で41.7点を失い、素材制約ディメンションは75.00点から83.30点へと8.3点上昇した。エンジニアリング判断は75.00点から50.00点へ、タスク表現は66.70点から58.30点へそれぞれ下落した。メインランキングはコード実行と素材制約の加重のみで構成されているため、コード実行の急激な下落が全体順位を直接引き下げた。

原因分析:抽選ランダム変動かモデル劣化か

Smoke評価は1日あたりディメンションごとに2問のみであり、サンプル数が極めて少ないため、1問の失敗で30〜40点規模の変動が生じ得る。本日のコード実行25.00点は2問とも基準を達成できなかったことを意味し、昨日の66.70点は少なくとも1問が通過していたことに対応する。素材制約が逆に向上していることは、モデルが制約遵守系の問題で安定したパフォーマンスを維持しており、システム的な劣化の兆候は見られないことを示している。エンジニアリング判断とタスク表現の下落幅はいずれもコード実行より小さく、問題がコード生成とデバッグ環節に集中していることを示唆している。

コード実行66.70→25.00、素材制約75.00→83.30という結果は、本日の失点が素材引用の正確性ではなく実行の正確性に集中していることを示している。

ユーザーへの具体的な意味

コード実行に大きく依存しているチームは、同一または類似の問題をローカル環境で即座に再テストする必要がある。Smoke評価の25.00点は2問全失に相当しており、このモデルを自動化スクリプト生成やアルゴリズム検証に使用している場合、エラー率が大幅に上昇する可能性がある。素材制約を重視するRAGシナリオへの影響は比較的小さく、当該ディメンションは本日むしろ向上している。

  • コード生成系タスク:人手によるレビュー工程の追加を推奨
  • 長鎖ツール呼び出し:昨日より安定したパフォーマンスを示したモデルへの切り替えを優先
  • 素材忠実度の要求が高いシナリオ:引き続き使用可能、緊急切り替えは不要

戦略的判断

1日あたり2問のみというテスト框架において、コード実行が1日で41.7点下落することは極端なケースに相当するが、抽選による変動と実際の能力変化を区別するには少なくとも3日間の継続観察が必要である。現時点では本日のデータのみでは、モデルが劣化の段階に入ったと判定することはできない。DeepSeek V4 Proのコード実行ディメンションを次期重点トラッキングリストに加え、2日連続で40点を下回った場合に選定優先度の調整を検討することを推奨する。

誠実性評価はpassを維持しており、モデルに回答拒否やフォーマット違反の問題は発生しておらず、問題は実行の正確性のみに集中していることを示している。


データ出典:YZ Index | Run #281 | 元データを見る