HPC-Ops × SGLang:テンセント混元の高性能Attention、Router GEMM、MoEカーネル
テンセントが開発したLLM推論向けオープンソース演算子ライブラリ「HPC-Ops」がSGLangのメインブランチに統合され、H20 GPU上でHy3モデルのTPOTを最大48.8%削減するなど、MoEモデルの推論性能を大幅に向上させることが
テンセントが開発したLLM推論向けオープンソース演算子ライブラリ「HPC-Ops」がSGLangのメインブランチに統合され、H20 GPU上でHy3モデルのTPOTを最大48.8%削減するなど、MoEモデルの推論性能を大幅に向上させることが
SGLangにおいて、MoEモデルのExpert Parallelism環境下でのトークンルーティング不均衡を解消するため、WaterfillとLPLBという2つのスケジューリング時負荷分散手法が導入された。2ノードHopper GPU上で