DeepSeek V4 Pro、コード実行スコアが25点急落――総合スコアも6.7点下落

DeepSeek V4 ProのSmokeテストにおいて、コード実行スコアが前日の100.00から75.00へと25点急落し、総合スコアも83.53から76.85へと下落した。ただし、現時点のデータはモデルの実質的な性能劣化を示すものではなく、サンプルサイズに起因するばらつきの可能性が高い。

DeepSeek V4 Pro 代码执行 Smoke评测
76

WDCD 5大シナリオ横断評価:ビジネスルールで全モデル最低、エンジニアリング規範の3点差が最も厳しい結果に

WDCD v3.1の5大シナリオ横断評価において、ビジネスルールシナリオが全モデルにとって最難関となり、エンジニアリング規範シナリオでは最大3点という大きなスコア差が生じた。Claude-opus-4.7はエンジニアリング規範のみ3/4にとどまり、最も顕著な「得意不得意の偏り」事例となった。

WDCD 守约测试 场景横评
50

WDCD三ラウンドアンカーテスト:R3誠実率わずか45.5%、GPT-5.5とQwen3 Maxの崩壊率20%

8問のv2アンカー問題を用いた3ラウンドテストにおいて、11モデルの平均R1確認率は0.95、R2抵抗率は0.86だったが、R3誠実率は45.5%まで低下し、9回の完全崩壊(0点)が発生した。この結果は、持続的なプレッシャー下でのモデルの約束遵守能力が急激に低下することを示している。

WDCD 守约测试 约束衰减
36

Claude Sonnet 4.6とGrok 4が96.98点で同率首位:2026年7月25日 Smokeクイックテストデータ速報

2026年7月25日のYZ Index Smokeクイックテストでは、11モデルを対象に評価が実施され、Claude Sonnet 4.6とGrok 4が96.98点で同率首位となった。本テストはコード実行と資料制約の2次元のみを対象とした日次10問の簡易測定であり、短期的なシグナル観測に適している。

赢政指数 Smoke快测 AI评测
253

MLPerf Tiny:超低消費電力AIの重要なベンチマーク

MLPerf Tinyは、マイクロコントローラーなどの超低消費電力デバイス上での機械学習性能を公平に比較するためのベンチマークスイートであり、精度・レイテンシ・推論あたりエネルギー消費量を統一された条件で評価する。TinyMLの普及に伴い、エネルギー効率が次世代エッジAIアプリケーションの重要な競争軸となっている。

MLC MLPerf Tiny TinyML
290