DeepSeek V4 Proは本日のSmoke評価において、コード実行次元のスコアが昨日の98.70点から75.00点へと23.7点下落し、メインランキング全体も91.46点から86.25点に下落した。
スコア比較データ
素材制約次元は82.60点から100.00点へと17.4点上昇した。エンジニアリング判断は100.00点から88.90点へと11.1点下落した。タスク表現は81.70点から91.70点へと10点上昇した。誠実性評価はpassを維持した。
原因分析:抽選によるばらつきか、実質的な劣化か
Smoke評価は1日あたり10問のみで、各次元2問ずつ出題されるため、1日のスコアの標準偏差は本来大きくなりやすい。コード実行次元での今回の失点は集中的に発生しており、複雑な多段階デバッグやエッジケースを要する問題が抽出されたことが原因として考えられる一方、昨日の問題は比較的平易だった可能性がある。素材制約次元が逆に満点まで上昇したことは、引用制約や忠実度においてモデルが今回安定したパフォーマンスを示したことを表しており、2つの次元が同時に極端な逆方向の変動を示したことは、モデルのパラメータや学習に系統的な劣化が生じたというよりも、問題の無作為抽選によるばらつきに起因するとの解釈がより合理的である。
エンジニアリング判断次元の11.1点下落はコード実行次元と同方向であり、タスク表現次元の10点上昇と部分的に相殺された結果、メインランキングは正味5.2点の下落となった。全体的な変動幅は依然として1日の簡易評価における正常範囲内にある。
利用者への示唆
自動化スクリプト生成やアルゴリズムのプロトタイプ検証チームなど、コード実行に強く依存する企業にとって、本日のデータはスコアが低い状態での出力をそのまま採用することを避けるため、人手によるレビュー工程を追加する必要があることを示唆している。素材制約次元が満点まで上昇したことは、原文の厳密な引用やハルシネーションの回避が求められる文書生成シナリオにおいて、むしろより高い信頼性を提供している。
エンジニアリング判断次元が88.90点に低下したことを受け、アーキテクチャの意思決定や複数案の比較検討が必要なプロジェクトでは、スコアがより安定したモデルに一時的に切り替えてクロスバリデーションを行うことを推奨する。
戦略的判断
1日間の比較に基づけば、コード実行スコアの急落は問題の抽選によるばらつきによって引き起こされた可能性が高く、モデルの実質的な劣化とは言いにくい。同一次元で2日以上連続して同様の下落幅が観測された場合に初めて、今回のSmoke評価の安定性に重点的な注意を払う必要がある。現時点のデータは、DeepSeek V4 Proのコード能力に対して長期的な下方修正判断を支持するものではない。
データ出典:YZ Index | Run #232 | 生データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接