SGLangがQwen3.8モデルのDay-0サポートを実現
SGLangはQwen3.8-2.4T-A95Bモデルに対してリリース当日(Day-0)サポートを実現し、ReplaySSMメカニズムやPrefill-Decode分離、チャンクパイプライン並列Prefillなどの機能を通じて高性能な推論を
SGLangはQwen3.8-2.4T-A95Bモデルに対してリリース当日(Day-0)サポートを実現し、ReplaySSMメカニズムやPrefill-Decode分離、チャンクパイプライン並列Prefillなどの機能を通じて高性能な推論を
SGLang RLチームがKimi K2に着想を得て、INT4 Quantization-Aware Training(QAT)のエンドツーエンドソリューションを実現。トレーニング段階のfake quantizationと推論段階のW4A1
SGLangとAutoRoundが正式に連携し、低ビット量子化による効率的なLLM推論をサポート。開発者はAutoRoundの符号勾配最適化技術でモデルを量子化し、SGLangの効率的なランタイムで直接デプロイできるようになりました。
SGLangがNVIDIA Model Optimizerをネイティブ統合し、フルプレシジョンモデルから高性能量子化エンドポイントへの直接変換を可能にした。この統合により、単一GPU上で最大2倍のスループット向上を実現している。