限界を突破する:H20上でのDeepSeek-V4-Proサービス最適化

限界を突破する:H20上でのDeepSeek-V4-Proサービス最適化
限界を突破する:H20上でのDeepSeek-V4-Proサービス最適化

1. はじめに

DeepSeek-V4-Proは1.6兆パラメータを持つMoEモデルであり、FP8およびFP4の両方の重みを提供する。このような大規模モデルはNVIDIA Blackwell GPUとの親和性が高いが、ネイティブFP4 Tensor Coreなどの優位性を欠くH20 GPUも依然として広く運用されている。

ハードウェアの制約があっても、サービス要件は変わらない。長いコンテキストのプリフィルにはTTFTの制御が必要であり、インタラクティブなデコードでは各サービス層のTPOT目標を満たす必要がある。

H20-96GB、H20-141GB、B300にわたるハードウェア仕様の比較。FP4・FP8演算性能、HBM容量、メモリ帯域幅、NVLink、RDMAを網羅

1つのモデルには複数のサービス構成が必要となる。ワークロードの特性、SLO、およびハードウェアの挙動が、デプロイトポロジーを共同で決定する。

2. ハードウェア制約からサービス構成へ

2.1 ハードウェア制約と役割分担

サービス役割別のハードウェア割り当て:H20-96GBはTTFT重視・短命ステートのプリフィルを担い、H20-141GBはKV容量制約・永続ステートのデコードを担う

2.2 容量の選択

Humming MXFP4AFP8を採用して重みの占有量を削減し、Online C128によりKV容量を拡張する。

2つの水平棒グラフパネルに、DP32-EP32およびPP2-TP8のフルトークン容量スケーリングを示す。ベースラインFP8からHumming MXFP4AFP8、Online C128への推移を表示

2.3 シナリオ別サービス構成

2つの独立したプリフィルデプロイ戦略:PP2とPP4はそれぞれ異なるレイヤー分割を使用するが、すべてのステージはAttention-CP8とMoE-TP8の同一実行パスに従うシングルノードTP8は破線の参照値であり、PP2-TP8は本デプロイで使用する2ノード低レイテンシサービスプロファイル。いずれもAttention-TP8とMoE-TP8を実行し、それぞれの後にAllReduceが続くプリフィルパスにおけるMoE-EPのMoE-TPへの置き換え対称メモリ集合通信はTPおよびCPの再利用可能な基盤を提供し、融合プリフィルカーネルは通信負荷の高いクリティカルパスを圧縮するHummingプリフィルワークフロー:ルーティングキャプチャから、個別のW13・W2チューニング、段階的検証へと進むPP2-TP8 DSpark実行:2つのパイプラインステージ間で協調し、ターゲット隠れ状態をステージ1に送信し、共有ステージチックプロトコルの下で受理済みトークンと次の候補を返す

バッチサイズ1において、H20-141GBは271出力トークン/秒を達成し、最適化後のプリフィルスループットは8.45k入力トークン/秒に達した。100万トークンのプロンプト処理は43.7秒で完了する。高スループットデコード構成では、1ノードあたり4.67k出力トークン/秒を実現する。