性能优化に関するAIニュース | Winzheng AI ニュース

SGLang-Diffusion 2ヶ月間の進展

SGLang-Diffusionは2025年11月の公開以来、速度が初期版の2.5倍に向上し、新モデルサポート、LoRA対応、並列処理の強化など多くの改善を実現しました。

NVIDIA DGX Spark上でSGLangを使用してGPT-OSS 20B/120Bモデルを高速に実行する方法を詳しく解説し、ローカルコーディングエージェントの実現を可能にします。

Mini-SGLangは、わずか5000行のPythonコードで最先端の性能を実現する軽量なLLM推論フレームワークで、教育用途と研究プロトタイピングの両方に最適化されています。

SGLangが視覚言語モデル（VLM）の視覚エンコーディングと言語処理を分離するEncoder-Prefill-Decode（EPD）アーキテクチャを発表し、視覚エンコーディング容量の独立拡張と大幅な性能向上を実現。

Novita AIがSGLangを用いたGLM4-MoEモデルの本番環境向け最適化を開発し、Shared Experts FusionやSuffix Decodingの統合により、エージェントコーディングワークロードでTTFTを最大65%削