Batch-1の限界を追求:BlackwellにおけるLing-3.0-flashの投機的デコード最適化
Ling-3.0-flashハイブリッド線形アテンションMoEモデルを4枚のBlwell GPU上で最適化し、平均TPOT54%削減・単一リクエストスループット2.1倍向上を達成した技術的取り組みを解説する。
Ling-3.0-flashハイブリッド線形アテンションMoEモデルを4枚のBlwell GPU上で最適化し、平均TPOT54%削減・単一リクエストスループット2.1倍向上を達成した技術的取り組みを解説する。
テンセントが開発したLLM推論向けオープンソース演算子ライブラリ「HPC-Ops」がSGLangのメインブランチに統合され、H20 GPU上でHy3モデルのTPOTを最大48.8%削減するなど、MoEモデルの推論性能を大幅に向上させることが
SGLangにおいて、MoEモデルのExpert Parallelism環境下でのトークンルーティング不均衡を解消するため、WaterfillとLPLBという2つのスケジューリング時負荷分散手法が導入された。2ノードHopper GPU上で