SGLangチームは、NVIDIA Nemotron 3.5 Lightningモデルのゼロデイサポートを発表した。このモデルは常時稼働のエージェントシナリオ向けに設計されており、ローカルシステム、エッジ、データセンター、クラウドで効率的に動作する。
Nemotron 3.5 Lightningの主な特徴
- アーキテクチャ:Mixture of Experts(MoE)アーキテクチャ
- パラメータ規模:総パラメータ数30B、アクティベーションパラメータはわずか3B
- コンテキスト長:最大100万トークンに対応
- 投機的デコードのサポート:MTP(Multi-Token Prediction)、DFlash、DSpark
- モダリティ:テキスト入力・出力
- デプロイプラットフォーム:DGX Spark、RTX、Jetson、H100/H200、B200など
SGLangによる迅速なデプロイ
SGLangは、連続バッチ処理、プレフィックスキャッシュ、OpenAI互換APIをサポートする高性能な推論ランタイムを提供する。以下はBF16チェックポイントを使用した起動コマンドである:
docker run --rm -it --gpus all lmsysorg/sglang:dev-nemotron3-5-lightning
sglang serve --model-path nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16起動後はOpenAIクライアントからリクエストを送信でき、enable_thinkingパラメータを通じて各ステップの推論のオン・オフを柔軟に制御できる。
投機的デコードによる推論の最適化
このモデルには3種類の投機的デコード技術が組み込まれている。MTPは軽量な予測ヘッドを用いて複数トークンを先読みし、DFlashは拡散型ドラフトモデルによって候補ブロックを並列生成する。DSparKは自己回帰と拡散の利点を組み合わせ、DGX Spark上で最高のパフォーマンスを発揮する。
効率性のベンチマーク結果
Nemotron 3.5 Lightningは高い精度を維持しながら、スループットを大幅に向上させる。

図に示すように、Nemotron 3.5 LightningはPinchBenchにおいて、同等の精度でタスクを完了する速度がQwen3.6-35Bより約30%速く、Gemma 4 26Bを大きく上回り、効率性の最前線に位置している。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接