限界を超えて:H20上でのDeepSeek-V4-Proのサービス最適化
DeepSeek-V4-Proは1.6兆パラメータを持つMoEモデルであり、H20 GPUという制約のあるハードウェア上でのサービング最適化において、TTFT・TPOT目標を達成しながら大幅なスループット改善を実現した取り組みを紹介する。
DeepSeek-V4-Proは1.6兆パラメータを持つMoEモデルであり、H20 GPUという制約のあるハードウェア上でのサービング最適化において、TTFT・TPOT目標を達成しながら大幅なスループット改善を実現した取り組みを紹介する。
SGLangにおけるCUDA Graphの実装戦略を解説し、独自技術であるBreakable CUDA Graph(BCG)がプリフィル段階においてeager実行比1.70倍の高速化を実現していることを紹介する。
NetpremeチームがNetpreme X-Mem™ MPUとSGLang HiCacheの統合方案を発表。KVキャッシュ専用の高帯域幅メモリ層を追加することで、長コンテキスト・高プレフィックス再利用シナリオにおいてTTFTを最大6.7倍
SGLangチームがNVIDIA GTC 2026に参加し、パネルディスカッション、Happy Hour、200人規模のMeetup、ハンズオントレーニングラボなど5つのイベントを3日間で開催。LLMエコシステムの中心で大きな成果を収めた。
SGLangとAutoRoundが正式に連携し、低ビット量子化による効率的なLLM推論をサポート。開発者はAutoRoundの符号勾配最適化技術でモデルを量子化し、SGLangの効率的なランタイムで直接デプロイできるようになりました。
Mini-SGLangは、わずか5000行のPythonコードで最先端の性能を実現する軽量なLLM推論フレームワークで、教育用途と研究プロトタイピングの両方に最適化されています。
SpecForgeチームが複数の業界パートナーと協力し、大規模データセットで訓練された本番環境対応のEAGLE-3モデルチェックポイント集「SpecBundle(Phase 1)」と、全面的に再構築されたSpecForge v0.2を発表。