DeepSeek V4 Pro、コード実行スコアが25点急落――総合スコアも6.7点下落
DeepSeek V4 ProのSmokeテストにおいて、コード実行スコアが前日の100.00から75.00へと25点急落し、総合スコアも83.53から76.85へと下落した。ただし、現時点のデータはモデルの実質的な性能劣化を示すものではな
DeepSeek V4 ProのSmokeテストにおいて、コード実行スコアが前日の100.00から75.00へと25点急落し、総合スコアも83.53から76.85へと下落した。ただし、現時点のデータはモデルの実質的な性能劣化を示すものではな
本日のSmokeベンチマークにおいて、DeepSeek V4 Proのコード実行スコアが100.00点から75.00点へと25点急落した一方、材料制約スコアは68.20点から95.00点へと26.8点上昇し、総合ランキングのスコアは85.6
DeepSeek V4 ProのSmoke評価において、材料制約スコアが31.8点急落した一方、コード実行スコアは30.5点急上昇し、ほぼ対称的な変動を示した。専門家はこれをモデルの構造的劣化ではなく、サンプリングのランダム性によるものと分
DeepSeek V4 Proが本日のSmoke評価においてメインランキングのスコアが93.84点から81.93点へと11.9ポイント下落した。特にコード実行と材料制約の2次元で大幅な低下が確認された。
DeepSeek V4 ProがSmoke評価のコード実行次元で98.70点から75.00点へと23.7点急落し、メインランキング全体も91.46点から86.25点に下落した。ただし、この変動は問題抽選によるばらつきの可能性が高く、モデルの
DeepSeek V4 ProがSmoke評価のメインランキングで96.99点から80.10点へと16.9点下落した。主な要因はコード実行次元の28点急落であり、サンプル数が少ないことによる問題抽選の変動が主因とみられる。
WDCD v3.1パイロット評価において、Grok 4が95.00点でトップに立ち、Claude Sonnet 4.6が64.10点で最下位となった。両者の差は30.9点に達する。
Smoke クイックテストの直近7日間データによると、DeepSeek V4 Pro は97.08から66.88まで急落し、平均79.8、トレンド-30.2を記録。一方GPT-5.5とClaude Sonnet 4.6は安定的に反発し、誠実
DeepSeek V4 Proが本日のSmoke評価で極端に分化した結果を示し、メインボードは87.99点まで急騰した一方、工程判断は10.00点に半減した。コード実行は満点を獲得したが、安定性とシステム的思考に明らかな短所が露呈している。
Smoke軽量評価の最新データで、Gemini 2.5 Proが実行能力の系統的失効により大幅下落。DeepSeek V4 Proが95.28点でトップに立ち、各モデルの素材制約スコアが集団的に下落する傾向が顕著となった。
DeepSeek V4 Pro が本日の Smoke 評価で信頼性評価を Fail から Pass へ転換し、メインランキングのスコアが 74.00 から 97.08 へと1日で 23.1 点上昇した。ただし、安定性が低いため、単日のデータ
Smoke軽量評価の最新データで、DeepSeek V4 Pro が97.08点で唯一97点を突破し首位を獲得。一方、ERNIE Botは実行スコアが半減し、主ランキングで1日あたり27.2点を失う激しい変動を見せた。
DeepSeek V4 Proがメインランキングで5点上昇したものの、誠実性評価がpassからfailに転落。コード実行が満点を獲得した一方で、素材制約と誠実性に問題が露呈した。
DeepSeek V4 Proが本日のSmoke評価でメイン榜得点が16.1点暴落し、誠実性評価もpassからfailに転落しました。単日のランダム変動ではなく、モデルの本当の退化を示唆する可能性が高いと分析します。