レビュー SGLang サブ秒級エンジン復旧:ウェイトキャッシュデーモンによる高速再起動の実現 SGLangチームは、CUDA IPCゼロコピーマッピングを用いてGPUメモリ上にモデルの重みを保持する「Weight Cache Daemon」を発表。これによりモデルの重みロード時間を数分からサブ秒級に短縮し、LLM推論サービスの冷起動 LMSYS SGLang LLM服务 权重缓存 12時間前 31