DeepSeek V4 Proは本日のSmokeテストにおいてコード実行次元のデータが欠損しており、素材制約スコアは55.60点となった。これによりメインランキングへの参加が不可能となった。
データの事実:次元別スコアと欠損状況
本日のスコア比較では、コード実行次元のデータが完全に欠損しており、素材制約次元のスコアは55.60点、エンジニアリング判断(サイドランキング、AI補助評価)は50.00点、タスク表現(サイドランキング、AI補助評価)は62.50点であった。昨日はすべての次元でスコアの記録がなく、今回のメインランキングは全体として欠損扱いとなっている。
原因分析:API障害と問題抽選のばらつきの区別
素材制約次元の55.60点とエンジニアリング判断の50.00点が記録されていることは、API呼び出しが実行段階で中断されたことを示している。コード実行次元はモデルがコードを直接実行して結果を返すことを要求するため、APIのタイムアウトによってこの次元のデータが空になる。一方、素材制約はテキストレベルの整合のみを必要とするため、55.60点のスコアを出力できた。タスク表現の62.50点がエンジニアリング判断を上回っていることは、モデルが指示の言い換え系の問題において比較的安定していることを示すが、エンジニアリング判断は多段階の論理チェーンを含むため、50.00点はサイドランキング評価における一貫性の不足を示している。
Smokeテストは1日あたり各次元2問のみで、問題の抽選自体にランダム性がある。モデルが真に性能低下した場合、通常は素材制約とタスク表現が同時に低下するが、今回は実行次元のみが欠損し、他の次元には数値が存在するため、モデル能力の全体的な低下ではなくAPI障害を示している。安定性次元はスコアの標準偏差を測定するが、今回は実行次元が未計測であるため標準偏差を算出できず、一貫性レベルの判断が不可能となっている。
利用者への示唆
コード実行を重視するチームがDeepSeek V4 Proを呼び出す際はタイムアウト時のリトライ機構を追加する必要がある。素材制約の55.60点は、文書忠実度のシナリオにおいて引き続き実用性があることを示しているが、実行段階の欠損はコード生成系アプリケーションに直接影響を与える。このモデルに依存する開発者はまずAPIの可用性を検証し、その後エンジニアリング判断50.00点が複雑なタスクに与える影響を評価すべきである。
素材忠実度に敏感なシナリオにおいて、55.60点は定量的なベースラインを提供する。ただし、タスクにコードの実行検証も必要とされる場合、今回のデータはモデル選定の意思決定を支えるには不十分である。
戦略的判断
現在のスコア比較に基づけば、DeepSeek V4 Proの今回の異常はモデルの実際の性能低下ではなく、主にAPI障害によって引き起こされている。メインランキング圏外というこの結果については、次回以降もコード実行次元が回復するかどうかを継続的に検証する価値がある。エンジニアリング判断50.00点とタスク表現62.50点の差は、サイドランキング能力に内部的な不均衡が存在することを示しており、今後の完全なデータでさらなる観察が必要である。
誠実性評価は今回のデータに異常を示しておらず、現時点では参入基準の判断に影響しない。安定性と可用性は運用シグナルとして機能するが、今回はデータが不完全なため具体的なスコアを算出できない。
データ出典:YZ Index | Run #279 | 元データを見る
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接