Doubao Pro のメインランキングが9.8点急落、資料制約が単日で13.7点下落

Doubao Pro は本日のSmokeベンチマーク・メインランキングで83.00点を記録し、昨日の92.85点から9.8点下落した。うち資料制約ディメンションは85.70点から72.00点へと低下した。

データの事実分解

コード実行は98.70点から92.00点へと6.7点低下、資料制約は13.7点の下落幅、エンジニアリング判断は100.00点から75.00点へと25点急落、一方でタスク表現は91.70点から100.00点へと8.3点上昇した。メインランキングはコード実行と資料制約の加重平均のみで構成されるため、資料制約の大幅な落ち込みが全体ランキングを直接押し下げた。

原因分析:サンプリングのばらつきか、真の性能劣化か

Smokeベンチマークは毎日10問のみ、各ディメンション2問という極めて少ないサンプル数であり、1問の得点変化だけで10点以上の変動が生じ得る。資料制約とエンジニアリング判断が同時に明確な低下を示したことから、最も考えられる原因は、本日の抽出問題が指示追従や多段階推論の要求が高い問題だったことである。タスク表現の得点上昇も問題分布のランダム性を裏付けており、モデル全体の能力が劣化したわけではない。誠実性評価は「pass」を維持しており、一貫性の問題は発生していない。

資料制約72.00点とエンジニアリング判断75.00点の組み合わせは、厳格な資料制限下でのモデルの多段階意思決定の安定性にサンプリング上の偏差が生じていることを示している。

利用者への具体的な意味

資料制約に強く依存するRAGシナリオの開発者は注意が必要だ。本日の72.00点は、原文の厳格な引用が求められるタスクにおいて、モデルがハルシネーションや見落としを起こすリスクが高まっていることを意味する。コード実行は92.00点を維持しており、純粋なコード生成タスクへの影響は限定的である。エンジニアリング判断の75.00点は、エンジニアリング上のトレードオフが必要な複雑なプロンプトシナリオにおいて、人手によるレビュー工程を追加することを推奨する。

  • 資料制約を重視するチーム:本日の得点はすでに75点の閾値を下回っており、本番環境での出力検証を強化する必要がある。
  • コード実行を主とするチーム:92.00点は依然として利用可能な範囲内にあり、継続使用して差し支えない。

戦略的判断

単日データに基づくと、Doubao Pro のメインランキングにおける9.8点の下落は、主に資料制約とエンジニアリング判断の両ディメンションにおける問題のサンプリングばらつきによるものであり、モデルの真の性能劣化ではない。次回のSmokeベンチマークで資料制約が引き続き80点を下回る場合は、システム的な問題が発生しているかどうかを重点的に検証する必要がある。現時点のデータは「サンプリングばらつきが主因」という結論を支持するにとどまり、同一ディメンションの得点標準偏差を3日間継続して観察することを推奨する。


データ出典:YZ Index | Run #340 | 元データを見る