SGLangがQwen3.8モデルのDay-0サポートを実現

SGLangがQwen3.8モデルのDay-0サポートを実現

モデルアーキテクチャ

Qwen3.8-2.4T-A95BはQwen3.5/3.6シリーズのハイブリッドアテンション設計を継承し、総パラメータ数は2.4T、1トークン当たりのアクティブパラメータは95B、全92層で構成される。

Qwen3.8-2.4T-A95B model architecture

主な特徴として、69個のGDN線形アテンション層と23個のGQA全アテンション層が3:1の比率で交互に配置されており、512エキスパートのMoE層(top-10ルーティング)を採用している。

コア機能サポート

各リクエストはKVキャッシュ、GDNリカレント状態、および畳み込みウィンドウを同時に維持する必要がある。SGLangはReplaySSMメカニズムによってMTP検証時の状態復元問題を解決しており、状態のスナップショットではなく入力のみを記録することで、ゼロオーバーヘッドのプレフィックスキャッシュと投機的デコードを実現している。

Prefill-Decode分離

PD分離は型付き状態レジストリを通じてKVキャッシュ、GDN状態、および畳み込みウィンドウを転送し、異なる並列レイアウトをサポートするとともに、ステージングバッファを活用してチャンク単位の重複転送を実現する。

チャンクパイプライン並列Prefill

純粋なPP Prefillは92層を各ステージに分割し、チャンク間の逆方向フローによってハンドオフと計算の重複を実現しており、Wide EPを大幅に上回る性能を発揮する。

Chunked pipeline-parallel prefill: chunks flow through stages back to back, so each hand-off overlaps the next chunk

パフォーマンス

8K入力/1K出力シナリオにおいて、NVFP4チェックポイントはTP8 B300上でMTPデコード346 tok/s、DSpark 378 tok/sを達成し、PD分離後は1GPU当たりの総スループットが最大5,126 tok/sに達した。

Aggregate and PD-disaggregated serving results at 8,192 input and 1,024 output tokens for the FP8 and NVFP4 checkpoints, total tok/s per GPU against per-user output speed

Day-0 RLサポート

MilesはネイティブNVFP4 LoRA RLを実装し、BF16 Megatronトレーナーと64枚のGB300を共有している。GSM8K GRPOの実験では、報酬の安定性とKL曲線の平坦性が確認された。

Qwen3.8 LoRA RL on GSM8K: eval score, rollout reward, and train/rollout KL