ハイライト概要
Muse Glimmerは30Bパラメータのマルチモーダル密集モデルであり、128k+トークンのコンテキストウィンドウを備え、ローカルハードウェア上でのエンドツーエンドのAgenticワークフロー向けに設計されている。SGLangは専用最適化を提供し、NVIDIA GeForce RTX 5090上でNVFP4とDFlash技術を活用することで、最大1452 tok/sの総出力スループットおよび236 tok/sのシングルユーザーデコード速度を実現する。
Muse Glimmerのモデルアーキテクチャ
Muse Glimmerは、27.9Bの密集テキストデコーダー、1.9BのViT、およびGELUマルチモーダルプロジェクターで構成される。テキストデコーダーは52層のTransformerを含み、各層にはグループクエリアテンション(32クエリヘッド、2キーバリューヘッド)とSwiGLUフィードフォワードネットワークが採用されている。デコーダーはハイブリッドアテンションパターンを使用し、4ステップごとに3つの2048トークンスライディングウィンドウ層と1つの全シーケンス層を交互に切り替え、RoPEとNoPEを組み合わせてコンテキスト長の拡張を実現する。
機能サポート
幅広いハードウェアバックエンドへの対応
SGLangはMuse Glimmerを、Apple Silicon(Mac mini、MシリーズMacBook Pro)、NVIDIA RTX 5090、RTX PRO 6000、DGX Sparkなどのローカルハードウェアへ展開することをサポートする。SM120プラットフォームでは最適化されたGEMMとFlashInferバックエンドを活用し、Apple SiliconではネイティブMLXバックエンドにより高性能なサービングを実現する。
DFlash投機的デコーディング
ユーザーは以下のコマンドでDFlashを有効にし、低レイテンシ推論を実現できる:--speculative-algorithm DFLASH。
ネイティブ最適化機能
本モデルはSGLangの低オーバーヘッドスケジューラー、RadixAttentionプレフィックスキャッシュ、および中断可能なCUDAグラフなどの最適化と互換性がある。MLXバックエンドにもプレフィックスキャッシュが導入され、Apple Silicon上のAgenticワークロードのパフォーマンスが向上している。
マルチフォーマットチェックポイント
BF16、NVFP4(約19.5GB)、GGUF Q4KMなどのフォーマットを提供し、異なるハードウェアおよび精度要件に対応する。
パフォーマンステスト結果
テストは7つのプラットフォームを対象に、バッチサイズ1〜8で実施された。DFlashはバッチサイズ1のインタラクティブ性を1.9〜4.3倍、バッチサイズ8の総スループットを1.4〜4.2倍向上させる。
- RTX 5090 (nvfp4 + DFlash): 236.4 tok/s/ユーザー(バッチ1)、1452 tok/s(バッチ8)
- B300 (nvfp4 + DFlash): 290.01 tok/s/ユーザー、1295 tok/s
- Apple M5 Pro (q4): 17.6 tok/s/ユーザー、56.9 tok/s
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接