モデルアーキテクチャ
Qwen3.8-2.4T-A95BはQwen3.5/3.6シリーズのハイブリッドアテンション設計を継承し、総パラメータ数は2.4T、1トークン当たりのアクティブパラメータは95B、全92層で構成される。

主な特徴として、69個のGDN線形アテンション層と23個のGQA全アテンション層が3:1の比率で交互に配置されており、512エキスパートのMoE層(top-10ルーティング)を採用している。
コア機能サポート
各リクエストはKVキャッシュ、GDNリカレント状態、および畳み込みウィンドウを同時に維持する必要がある。SGLangはReplaySSMメカニズムによってMTP検証時の状態復元問題を解決しており、状態のスナップショットではなく入力のみを記録することで、ゼロオーバーヘッドのプレフィックスキャッシュと投機的デコードを実現している。
Prefill-Decode分離
PD分離は型付き状態レジストリを通じてKVキャッシュ、GDN状態、および畳み込みウィンドウを転送し、異なる並列レイアウトをサポートするとともに、ステージングバッファを活用してチャンク単位の重複転送を実現する。
チャンクパイプライン並列Prefill
純粋なPP Prefillは92層を各ステージに分割し、チャンク間の逆方向フローによってハンドオフと計算の重複を実現しており、Wide EPを大幅に上回る性能を発揮する。
パフォーマンス
8K入力/1K出力シナリオにおいて、NVFP4チェックポイントはTP8 B300上でMTPデコード346 tok/s、DSpark 378 tok/sを達成し、PD分離後は1GPU当たりの総スループットが最大5,126 tok/sに達した。
Day-0 RLサポート
MilesはネイティブNVFP4 LoRA RLを実装し、BF16 Megatronトレーナーと64枚のGB300を共有している。GSM8K GRPOの実験では、報酬の安定性とKL曲線の平坦性が確認された。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接