TL;DR
SOTAモデルの規模が拡大し続けるにつれ、サービスクラッシュ後のモデル再ロードコストは極めて高くなっている。これに対応するため、われわれはWeight Cache Daemonを発表する。これは永続化されたGPUプロセスであり、CUDA IPCゼロコピーマッピングを通じて量化後のモデルの重みをGPUメモリ上に保持し、新たなSGLangエンジンインスタンスへ提供する。これにより、重みのロード時間を数分からサブ秒級に短縮する。
Weight Cache DaemonはFast Engine Recovery Frameworkの第一フェーズであり、本番環境のLLMサービスにおいてコールド再起動を10秒未満、ホットスタンバイ切り替えを1秒未満で実現することを目標としている。
主な成果
- 重みのロード時間:約495秒 → 約0.63秒、約785倍の高速化(Ling-2.6-1T FP8モデルに基づく)
- 総起動時間:8.8分 → 0.528分、エンドツーエンドのエンジン起動時間を93.9%削減
- マルチインスタンスの重み共有:同一GPU上の複数エンジンインスタンスがIPCハンドルを共有し、重複するディスクI/Oおよび量化後の変換処理を排除
- アクティブ-スタンバイフェイルオーバーが1秒未満:ゼロコピー共有の重みにより、ほぼダウンタイムなしの切り替えを実現。スタンバイ副本のために完全なGPUを予約する必要がない
- マルチノードインスタンスの重み共有:大規模モデルのマルチノードモードをサポート
背景
LLMモデルの規模拡大(Qwen3-235B、Ling-2.6-1T、および新たにリリースされた2.8T Kimi K3など)に伴い、サービスエンジンのコールドスタート時間は本番効率における重要なボトルネックとなっている。Ling-2.6-1T FP8インスタンスは、重みを3.5T NVMe SSDに保存した状態で、8×H20-3e GPU上で準備完了まで約8.52分を要する。
分析の結果、ディスクからの重みロードが起動時間の93.9%を占めることが判明した。結果として得られるテンソルは決定論的であるにもかかわらず、再起動のたびに同一のディスク読み取り、デシリアライズ、テンソル並列(TP)シャーディング、および量化後の処理が繰り返し実行されている。
設計
コアアイデア:CUDA IPCによる永続化ウェイトキャッシュ
Weight Cache Daemonは、量化後かつTP分割済みの重みを保持する永続化GPUプロセスである。エンジン再起動時にはCUDA IPCゼロコピーで重みをマッピングし、ディスクI/O、デシリアライズ、再量化が一切不要となる。
Metaデバイスに基づくゼロコピーロード
エンジンはmetaデバイス上でモデルを初期化した後、パラメータのデータポインタを直接IPCマッピングされたテンソルに置き換えることで、ゼロコピーを実現する。
設定検証と安全機構
設定の不一致が検出された場合、完全なディスク再ロードがトリガーされ、正確性が保証される。量化方式はIPCのホワイトリストによって制限される。
本番環境での活用シナリオ
本ソリューションは、マルチインスタンスの重み共有、優先度付きの共同サービス提供、およびアクティブ-スタンバイフェイルオーバーといった本番環境のパターンをサポートする。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接