Blackwellネイティブ8/4ビットRLへの道:MilesにおけるエンドツーエンドMXFP8とNVFP4の実践
本記事では、低精度強化学習(RL)においてBlackwellアーキテクチャのネイティブ形式であるMXFP8とNVFP4をMilesおよびSGLang RLエコシステムへ統合する2つの方式を解説し、学習の安定性を確保するための高精度レイヤー保
本記事では、低精度強化学習(RL)においてBlackwellアーキテクチャのネイティブ形式であるMXFP8とNVFP4をMilesおよびSGLang RLエコシステムへ統合する2つの方式を解説し、学習の安定性を確保するための高精度レイヤー保
SGLangチームがGB200 NVL72上でDeepSeek V3/R1の推論性能を大幅に最適化し、FP8 attentionとNVFP4 MoEなどの技術により、H100と比較してプリフィル3.8倍、デコード4.8倍のスループット向上を