SGL-Diffusion における AR+DiT フルスタックパフォーマンス最適化
HFバックエンドをSRTに置き換えてAR+DiTハイブリッド生成フレームワークを最適化し、エンドツーエンドのレイテンシを最大77.2%削減するとともに、動的バッチ処理や分離アーキテクチャによってスループットと並列効率を大幅に向上させた。
HFバックエンドをSRTに置き換えてAR+DiTハイブリッド生成フレームワークを最適化し、エンドツーエンドのレイテンシを最大77.2%削減するとともに、動的バッチ処理や分離アーキテクチャによってスループットと並列効率を大幅に向上させた。
Google DeepMindが拡散モデルをテキスト生成に応用したDiffusionGemmaを発表し、ローカルデバイス上で従来のTransformerモデルより4倍速い推論速度を実現した。
SGLang-Diffusionがプロダクショングレードのビデオ生成フレームワークとして、トークンレベルのシーケンス分割、分散VAE、融合カーネルなどの深層最適化を実装し、大規模な拡散モデルのデプロイメントを実現。