限界を超えて:H20上でのDeepSeek-V4-Proのサービス最適化
DeepSeek-V4-Proは1.6兆パラメータを持つMoEモデルであり、H20 GPUという制約のあるハードウェア上でのサービング最適化において、TTFT・TPOT目標を達成しながら大幅なスループット改善を実現した取り組みを紹介する。
DeepSeek-V4-Proは1.6兆パラメータを持つMoEモデルであり、H20 GPUという制約のあるハードウェア上でのサービング最適化において、TTFT・TPOT目標を達成しながら大幅なスループット改善を実現した取り組みを紹介する。
SGLangチームは、CUDA IPCゼロコピーマッピングを用いてGPUメモリ上にモデルの重みを保持する「Weight Cache Daemon」を発表。これによりモデルの重みロード時間を数分からサブ秒級に短縮し、LLM推論サービスの冷起動
Ling-3.0-flashハイブリッド線形アテンションMoEモデルを4枚のBlwell GPU上で最適化し、平均TPOT54%削減・単一リクエストスループット2.1倍向上を達成した技術的取り組みを解説する。
QwenチームがマルチモーダルMoEモデル「Qwen3.8-Flash-Next」をオープンソース公開し、SGLangがQwen・NVIDIA・AMDチームと連携してDay-0サポートを提供した。本モデルはQwen4アーキテクチャの早期プレ
SGLang Diffusionチームが8×NVIDIA H200上でMiniMax-H3の動画生成ベンチマークを実施し、無損失パスでDiffusersと比較して最大1.95倍、ステップ再利用とスパースアテンション併用で最大6.24倍の高速
Infer-forgeは、SGLangを核として推論最適化の実行環境を体系化するMonoRepoおよびTaskLoop設計の取り組みであり、内部での継続的運用を通じて並行タスク数の大幅な拡大を実現している。
SGLangは30Bパラメータのマルチモーダルモデル「Muse Glimmer」のDay-0サポートを実装し、NVIDIA GeForce RTX 5090上でNVFP4とDFlash技術を活用して最大1452 tok/sの総出力スループッ
統合基数キャッシュ(Unified Radix Cache)は、ハイブリッドモデルにおける複数のKV再利用ルールを単一のradix木トポロジーと交換可能なコンポーネントで管理する手法で、HiCacheとの統合によりマルチターンベンチマークで
SGLangチームがNVIDIA Nemotron 3.5 Lightningモデルのゼロデイサポートを発表した。同モデルは常時稼働のエージェントシナリオ向けに設計され、高効率な推論ランタイムを通じて迅速なデプロイが可能となっている。
SGLangはQwen3.8-2.4T-A95Bモデルに対してリリース当日(Day-0)サポートを実現し、ReplaySSMメカニズムやPrefill-Decode分離、チャンクパイプライン並列Prefillなどの機能を通じて高性能な推論を
SGLangにおけるCUDA Graphの実装戦略を解説し、独自技術であるBreakable CUDA Graph(BCG)がプリフィル段階においてeager実行比1.70倍の高速化を実現していることを紹介する。
Miles v0.1は、フロンティア規模の強化学習(RL)トレーニングを研究者や開発者に提供するために設計されたフルスタックのプロダクションレベルシステムであり、精度・効率・信頼性・拡張性を最優先に掲げている。
SpecForgeチームがv0.3.0をリリースし、ターゲットモデルの推論とドラフトモデルのトレーニングを完全に分離。オンライン・オフライン・デカップリングワークフローを統合し、より広範な推測デコードアルゴリズムをサポートする。
HFバックエンドをSRTに置き換えてAR+DiTハイブリッド生成フレームワークを最適化し、エンドツーエンドのレイテンシを最大77.2%削減するとともに、動的バッチ処理や分離アーキテクチャによってスループットと並列効率を大幅に向上させた。
SGLangチームとMilesは、初のオープンソース3兆パラメータ級モデルであるKimi K3に対してDay-0サポートを正式に発表した。SGLangが推論を、MilesがRL学習を担当し、リリース日のあらゆるシナリオをカバーする。
RadixArkとGoogle Cloudがオープンソース推論フレームワーク「SGLang」をTPUエコシステムへ全面導入する提携を正式発表した。開発者はGPUとTPUを同一APIで使い分けられるようになる。
SGLangのissue #15194で提案されたアーキテクチャ変更を解説する。新設計では、チェックポイント解釈・パラメータ登録・重みロード・後処理・カーネル実行を独立した再利用可能なコンポーネントに分離し、量化スタックの保守性と拡張性を大
NetpremeチームがNetpreme X-Mem™ MPUとSGLang HiCacheの統合方案を発表。KVキャッシュ専用の高帯域幅メモリ層を追加することで、長コンテキスト・高プレフィックス再利用シナリオにおいてTTFTを最大6.7倍
Speculative Decodingの高負荷時における検証コスト問題に対処するDSparkがSGLangに統合された。Semi-autoregressiveブロックドラフターと信頼度ベースの動的verify長割り当てにより、Denseモ
AMDとMilesチームが、DeepSeek-V4 Flash RLをROCm搭載のAMD Instinct MI355X GPU上でMilesフレームワークによるエンドツーエンドの強化学習トレーニングに対応させたことを発表した。4ノード構