DeepSeek V4 Proは本日のSmokeベンチマークにおいて、コード実行スコアが昨日の100.00点から75.00点へと急落した一方、材料制約スコアは68.20点から95.00点へと上昇し、総合ランキングのスコアは85.69点から84.00点に変動した。
データの事実:各スコアと総合ランキングの変動
コード実行スコアは1日で25点低下し、エンジニアリング判断スコアは94.50点から75.00点へと下落、タスク表現スコアも4.7点小幅に低下して90.00点となった。材料制約スコアが26.8点上昇したことでコード実行の損失がほぼ相殺され、総合ランキングの低下は1.7点にとどまった。誠実性評価は「pass」を維持している。
原因分析:問題抽選による変動か、モデルの劣化か
Smokeベンチマークは1日あたり10問のみで、各スコア区分につき2問という極めて少ないサンプル数であるため、1日あたりのスコアの標準偏差は本来大きい。コード実行とエンジニアリング判断が同時に19.5点以上の下落を示した最も可能性の高い原因は、当日抽選された2問のコード問題が前日より難易度が著しく高く、境界条件の処理や多段階の推論チェーンでモデルが誤りを犯したことと考えられる。材料制約スコアが大幅に上昇したことは、当日の材料問題がモデルの学習分布により近く、幻覚やフォーマット違反が減少した可能性を示している。
真にモデルが劣化している場合、通常は複数のスコア区分で同時かつ継続的な下落が伴い、材料制約スコアが逆方向に大幅上昇するような現象は生じにくい。現時点のデータは1日限りの相反する変動を示しているに過ぎず、複数日にわたって同一スコア区分が継続的に低下している証拠はないため、問題抽選による変動と判断するのがより妥当である。
利用者への意味
コード実行に強く依存するチームがDeepSeek V4 Proを使用する際には、特に複雑なアルゴリズムや複数ファイルが絡む処理シナリオにおいて、ローカルでのテスト工程を追加する必要がある。75点という単回のスコアは、生成コードの合格率低下につながる可能性がある。一方、材料制約スコアの95点は、ユーザーが提供した文書やフォーマット要件への厳密な準拠においてモデルがより安定していることを示しており、高い忠実性が求められるドキュメント生成やデータ抽出タスクに適している。
エンジニアリング判断スコアが75点まで低下したことから、モデルにアーキテクチャ上の意思決定やコードレビューを補助させる開発者は、単回出力への信頼度を下げ、人手によるレビュー工程を追加することが推奨される。
戦略的判断
総合ランキングの低下が1.7点にとどまったことは、コード実行とエンジニアリング判断の実際の変動を覆い隠しており、現在の総合ランキングの計算式が材料制約に高いウェイトを置いていることを示している。DeepSeek V4 Proのコード実行における単日スコアはすでに75点の水準に戻っており、次回のベンチマークでこのスコアが90点以上に回復しない場合は、性能劣化シグナルの発生について重点的に検証する必要がある。現時点では1日分のデータのみであるため、通常の抽選によるサンプリング変動と判断するのが合理的である。
コード実行75.00点と材料制約95.00点という相反する動向は、今回のベンチマークで最も記録に値する現象である。
モデル選定を行う企業にとって、DeepSeek V4 Proは依然として材料制約を優先するシナリオの候補モデルとなり得るが、コード生成パイプラインでは代替案を残しておくことが推奨される。次回のSmokeベンチマークでコード実行とエンジニアリング判断のスコアが同時に回復すれば、今回がランダムな変動であったと確認できる。引き続き低い水準が続く場合は、さらなる観察が必要である。
データ出典:YZ Index | Run #250 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接