
1. アーキテクチャ概要
DeepSeek-V4.1は複数のアーキテクチャ上の選択を導入しており、サービングスタックの設計に大きな影響を与えている。低比率圧縮とスライディングウィンドウアテンション(SWA)により、各層はfp8スライディングウィンドウキャッシュ(直近128ポジション)を維持しながら、選択されたソース層が長距離アテンション用のfp4圧縮表現を生成する。
マニフォールドハイパーコネクション(mHC)により、サブ層はトークン依存の混合係数を通じて4本の並列残差ストリームへの読み書きが可能になる。Engramメモリは第1層と第14層が2つの大型fp8テーブルからn-gramハッシュキー付き行を検索できるようにする。
2. 層間共有とスパース検索
4つのKVソース層が圧縮KVとインデックスキーを生成し、コンシューマ層は最新のソースを直接読み取ることで重複保存を回避する。第20層は最大2048個の候補ブロックを選出して公開し、後続のインデックスソース層がその中からtop-512を選択する。
図1. 各層の役割と層間共有の概略図。
3. Engram最適化
Engramの2つのfp8テーブルは合計189GiBであり、各ステップで読み取る行数は少量にとどまる。SGLangはGPUまたはホストメモリへの配置をサポートする。ホストシャード配置ではall-reduceを保持し、共有ホスト配置ではその通信を排除する。
図2. EngramのTP4構成における配置とルックアップ通信。
4x GB300での実測では、ホストオフロードによりKVキャッシュ容量が36%向上し、スループットとTTFTは同等を維持した。
4. SWA有界リプレイ
エンコーダ側の有界リプレイは圧縮KVとインデックスキーを保持し、リクエストは128ポジションのウィンドウを維持して、ヒット時は末尾128トークンのみを再計算する。デコーダ側の末尾のみ計算では、第21〜39層が最後の128トークンのみを処理する。
図3. エンコーダの再構成とデコーダの末尾プリフィル。
8x H200上でのデコーダリプレイにより、プリフィルスループットが1.56倍向上し、AIME 2026評価のpass@1は一貫した結果を維持した。
5. カーネルと実行の最適化
SGLangはmHCの前段事前混合オーバーラップ、FP4インデックスTPレプリケーション、RoPEとFP4量化の融合を実装し、量化セマンティクスを保持する。単一トークン投影とEngramの融合により、各デコードステップのオーバーヘッドをさらに低減する。
6. MilesにおけるRLトレーニング
MilesはDeepSeek-V4.1向けにMegatron-Coreプラグインを提供し、SGLangを用いてrolloutを実行する。DP/TP/SP/EP/PP/CPの並列化および量化対応トレーニングをサポートし、trainerとrollout間のlog-probabilityの乖離を最小限に抑える。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接