Blackwellネイティブ8/4ビットRLへの道:MilesにおけるエンドツーエンドMXFP8とNVFP4の実践
本記事では、低精度強化学習(RL)においてBlackwellアーキテクチャのネイティブ形式であるMXFP8とNVFP4をMilesおよびSGLang RLエコシステムへ統合する2つの方式を解説し、学習の安定性を確保するための高精度レイヤー保
本記事では、低精度強化学習(RL)においてBlackwellアーキテクチャのネイティブ形式であるMXFP8とNVFP4をMilesおよびSGLang RLエコシステムへ統合する2つの方式を解説し、学習の安定性を確保するための高精度レイヤー保
SGLangチームがGLM-5.2-NVFP4の推論サービスを2週間で大幅最適化し、8×B300・バッチサイズ1の低レイテンシ環境で500 TPS超を達成した。Spec V2、IndexShare MTP、TopK-V2など複数のランタイム