1. はじめに
DeepSeek-V4-Proは1.6兆パラメータを持つMoEモデルであり、FP8およびFP4の両方の重みを提供する。このような大規模モデルはNVIDIA Blackwell GPUに適しているが、ネイティブFP4 Tensor Coreなどの利点を欠くH20 GPUも依然として広く展開されている。
ハードウェアの制約があっても、サービス要件が下がるわけではない。長いコンテキストのプリフィルではTTFTを制御する必要があり、インタラクティブなデコードでは各サービス層のTPOT目標を満たす必要がある。
1つのモデルに複数のサービス構成が必要となる。ワークロードの特性、SLO、およびハードウェアの挙動が、デプロイトポロジを共同で決定する。
2. ハードウェア制約からサービス構成へ
2.1 ハードウェア制約と役割分担
2.2 容量の選択
Humming MXFP4AFP8を採用して重みのメモリ占有量を削減し、Online C128によってKV容量を拡張する。
2.3 シナリオ別サービス構成
バッチサイズ1において、H20-141GBは271 output tokens/sを達成し、最適化後のプリフィルスループットは8.45k input tokens/sに達し、100万トークンのプロンプト処理はわずか43.7秒で完了する。高スループットデコード構成では、1ノードあたり4.67k output tokens/sを実現する。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接