SGLang サブ秒級エンジン復旧:ウェイトキャッシュデーモンによる高速再起動の実現
SGLangチームは、CUDA IPCゼロコピーマッピングを用いてGPUメモリ上にモデルの重みを保持する「Weight Cache Daemon」を発表。これによりモデルの重みロード時間を数分からサブ秒級に短縮し、LLM推論サービスの冷起動
SGLangチームは、CUDA IPCゼロコピーマッピングを用いてGPUメモリ上にモデルの重みを保持する「Weight Cache Daemon」を発表。これによりモデルの重みロード時間を数分からサブ秒級に短縮し、LLM推論サービスの冷起動
NVIDIA GPUのGreenContext技術を活用し、同一インスタンス内でprefillとdecodeを効率的に多重化する新しいLLMサービスパラダイム「PD-Multiplexing」を提案し、SGLangで実装した初期成果を紹介し