
1. はじめに
DeepSeek-V4-Proは1.6兆パラメータを持つMoEモデルであり、FP8およびFP4の両方の重みを提供する。このような大規模モデルはNVIDIA Blackwell GPUとの親和性が高いが、ネイティブFP4 Tensor Coreなどの優位性を欠くH20 GPUも依然として広く運用されている。
ハードウェアの制約があっても、サービス要件は変わらない。長いコンテキストのプリフィルにはTTFTの制御が必要であり、インタラクティブなデコードでは各サービス層のTPOT目標を満たす必要がある。
1つのモデルには複数のサービス構成が必要となる。ワークロードの特性、SLO、およびハードウェアの挙動が、デプロイトポロジーを共同で決定する。
2. ハードウェア制約からサービス構成へ
2.1 ハードウェア制約と役割分担
2.2 容量の選択
Humming MXFP4AFP8を採用して重みの占有量を削減し、Online C128によりKV容量を拡張する。
2.3 シナリオ別サービス構成
バッチサイズ1において、H20-141GBは271出力トークン/秒を達成し、最適化後のプリフィルスループットは8.45k入力トークン/秒に達した。100万トークンのプロンプト処理は43.7秒で完了する。高スループットデコード構成では、1ノードあたり4.67k出力トークン/秒を実現する。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接