NVFP4 KV Cacheが長コンテキスト・Agent推論を高速化

NVFP4 KV Cacheが長コンテキスト・Agent推論を高速化

KVキャッシュは現代のLLM推論システムの中核コンポーネントである。マルチターンAgentセッションのコンテキストはキーバリューペアの形式でGPUメモリにキャッシュされ、後続のデコードステップで再利用される。コンテキストウィンドウの拡大に伴い、KVキャッシュがVRAM容量と帯域幅に与える負荷はますます大きくなっている。

NVFP4フォーマットと二段階スケーリング

NVIDIAはBlackwellアーキテクチャにおいてNVFP4フォーマットを導入した。E2M1の4ビット値に加え、16値ブロック単位のFP8ブロックレベルスケーリングとFP32テンソルレベルスケーリングを組み合わせることで、量子化誤差を効果的に抑制する。

Figure 1. NVFP4 two-level scaling per-block and per-tensor quantization strategy

SGLangにおけるNVFP4 KVの実装

実装はSGLangのページングKVキャッシュと、初期プリフィル・ブロック単位プリフィル/拡張・デコードの3種類のアテンションパスを接続する。

Figure 2. NVFP4 KV cache implementation in SGLang

デコードアテンションカーネルの設計

デコードフェーズのカーネルはNVFP4 KVキャッシュから直接データを読み出し、カーネル内でFP8へのリアルタイム逆量子化を完結させることで、余分なメモリラウンドトリップを回避する。

Figure 3. NVFP4 KV attention decode kernel design

精度評価

Qwen3.5-397B-A17Bにおいて、NVFP4とFP8の精度差は極めて小さく(0.1%未満)。Qwen3.8-27Bでは一部タスクで0.3〜1.6ポイントの精度低下が見られる。

Figure 4. Accuracy benchmark on Qwen3.5-397B-A17BFigure 5. Accuracy benchmark on Qwen3.8-27B

パフォーマンス

単一のRTX PRO 6000 Blackwell GPUでのテストでは、NVFP4 KVによりデコードスループットが26〜30%向上し、より高い同時実行数をサポートすることが確認された。

Figure 6. Iso-concurrency decode performance on Qwen3.8-27BFigure 7. Iso-capacity decode performance on Qwen3.8-27BFigure 8. Pareto curve of 32K/1K ISL/OSL on Qwen3.8-27BFigure 9. Prefill performance measured by TTFT on Qwen3.8-27BFigure 10. AgentX performance on Qwen3.5-397B-A17B

以上の結果は、NVFP4 KV Cacheが高い精度を維持しながら、長コンテキストおよびAgent推論の効率を大幅に向上させることを示している。