SGLang 高度CUDA Graphテクノロジー解析
SGLangにおけるCUDA Graphの実装戦略を解説し、独自技術であるBreakable CUDA Graph(BCG)がプリフィル段階においてeager実行比1.70倍の高速化を実現していることを紹介する。
SGLangにおけるCUDA Graphの実装戦略を解説し、独自技術であるBreakable CUDA Graph(BCG)がプリフィル段階においてeager実行比1.70倍の高速化を実現していることを紹介する。
HFバックエンドをSRTに置き換えてAR+DiTハイブリッド生成フレームワークを最適化し、エンドツーエンドのレイテンシを最大77.2%削減するとともに、動的バッチ処理や分離アーキテクチャによってスループットと並列効率を大幅に向上させた。
SGLang の開発においてエージェント支援開発の実践が進んでおり、CUDA クラッシュデバッグからカーネル最適化、性能ループまでをカバーする実行可能な SKILL.md やスクリプト群として工程知識を体系化する取り組みを紹介する。エージェ
SGLangコミュニティが提案する異種CPU+GPU構成のEPD分離アーキテクチャにより、VLMサービスにおける視覚エンコードのボトルネックを解消し、TTFTやTPOTなどの主要指標で純GPU構成を上回る性能を実現した。
DeepSeek-V4はリリース初日に推論と強化学習のトレーニングをサポートし、SGLangとMilesが初のオープンソース技術スタックとしてこのモデルを支援しています。特に混合稀疏注意力アーキテクチャ、流形制約ハイパーコネクション(mHC
MLCommonsは、個人用コンピュータのAI性能を評価するための最新バージョンであるMLPerf Client v1.6を発表しました。このバージョンでは、基準テストの体験を最適化し、重要なソフトウェアコンポーネントを更新し、利用性と性能