SGLangがMuse GlimmerのDay-0サポートを実現、ローカルAgentic推論を最適化

SGLangがMuse GlimmerのDay-0サポートを実現、ローカルAgentic推論を最適化

ハイライト概要

Muse Glimmerは30Bパラメータのマルチモーダル密集モデルであり、128k+トークンのコンテキストウィンドウを備え、ローカルハードウェア上でのエンドツーエンドのAgenticワークフロー向けに設計されている。SGLangは専用最適化を提供し、NVIDIA GeForce RTX 5090上でNVFP4とDFlash技術を活用することで、最大1452 tok/sの総出力スループットおよび236 tok/sのシングルユーザーデコード速度を実現する。

Muse Glimmerのモデルアーキテクチャ

Muse Glimmerは、27.9Bの密集テキストデコーダー、1.9BのViT、およびGELUマルチモーダルプロジェクターで構成される。テキストデコーダーは52層のTransformerを含み、各層にはグループクエリアテンション(32クエリヘッド、2キーバリューヘッド)とSwiGLUフィードフォワードネットワークが採用されている。デコーダーはハイブリッドアテンションパターンを使用し、4ステップごとに3つの2048トークンスライディングウィンドウ層と1つの全シーケンス層を交互に切り替え、RoPEとNoPEを組み合わせてコンテキスト長の拡張を実現する。

機能サポート

幅広いハードウェアバックエンドへの対応

SGLangはMuse Glimmerを、Apple Silicon(Mac mini、MシリーズMacBook Pro)、NVIDIA RTX 5090、RTX PRO 6000、DGX Sparkなどのローカルハードウェアへ展開することをサポートする。SM120プラットフォームでは最適化されたGEMMとFlashInferバックエンドを活用し、Apple SiliconではネイティブMLXバックエンドにより高性能なサービングを実現する。

DFlash投機的デコーディング

ユーザーは以下のコマンドでDFlashを有効にし、低レイテンシ推論を実現できる:--speculative-algorithm DFLASH

ネイティブ最適化機能

本モデルはSGLangの低オーバーヘッドスケジューラー、RadixAttentionプレフィックスキャッシュ、および中断可能なCUDAグラフなどの最適化と互換性がある。MLXバックエンドにもプレフィックスキャッシュが導入され、Apple Silicon上のAgenticワークロードのパフォーマンスが向上している。

マルチフォーマットチェックポイント

BF16、NVFP4(約19.5GB)、GGUF Q4KMなどのフォーマットを提供し、異なるハードウェアおよび精度要件に対応する。

パフォーマンステスト結果

テストは7つのプラットフォームを対象に、バッチサイズ1〜8で実施された。DFlashはバッチサイズ1のインタラクティブ性を1.9〜4.3倍、バッチサイズ8の総スループットを1.4〜4.2倍向上させる。

  • RTX 5090 (nvfp4 + DFlash): 236.4 tok/s/ユーザー(バッチ1)、1452 tok/s(バッチ8)
  • B300 (nvfp4 + DFlash): 290.01 tok/s/ユーザー、1295 tok/s
  • Apple M5 Pro (q4): 17.6 tok/s/ユーザー、56.9 tok/s