SGLangがNVIDIA Nemotron 3.5 Lightningのゼロデイサポートを実現

SGLangがNVIDIA Nemotron 3.5 Lightningのゼロデイサポートを実現

SGLangチームは、NVIDIA Nemotron 3.5 Lightningモデルのゼロデイサポートを発表した。このモデルは常時稼働のエージェントシナリオ向けに設計されており、ローカルシステム、エッジ、データセンター、クラウドで効率的に動作する。

Nemotron 3.5 Lightningの主な特徴

  • アーキテクチャ:Mixture of Experts(MoE)アーキテクチャ
  • パラメータ規模:総パラメータ数30B、アクティベーションパラメータはわずか3B
  • コンテキスト長:最大100万トークンに対応
  • 投機的デコードのサポート:MTP(Multi-Token Prediction)、DFlash、DSpark
  • モダリティ:テキスト入力・出力
  • デプロイプラットフォーム:DGX Spark、RTX、Jetson、H100/H200、B200など

SGLangによる迅速なデプロイ

SGLangは、連続バッチ処理、プレフィックスキャッシュ、OpenAI互換APIをサポートする高性能な推論ランタイムを提供する。以下はBF16チェックポイントを使用した起動コマンドである:

docker run --rm -it --gpus all lmsysorg/sglang:dev-nemotron3-5-lightning
sglang serve --model-path nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16

起動後はOpenAIクライアントからリクエストを送信でき、enable_thinkingパラメータを通じて各ステップの推論のオン・オフを柔軟に制御できる。

投機的デコードによる推論の最適化

このモデルには3種類の投機的デコード技術が組み込まれている。MTPは軽量な予測ヘッドを用いて複数トークンを先読みし、DFlashは拡散型ドラフトモデルによって候補ブロックを並列生成する。DSparKは自己回帰と拡散の利点を組み合わせ、DGX Spark上で最高のパフォーマンスを発揮する。

効率性のベンチマーク結果

Nemotron 3.5 Lightningは高い精度を維持しながら、スループットを大幅に向上させる。

Line chart comparing PinchBench accuracy with time to complete 10,000 tasks. Nemotron 3.5 Lightning reaches similar accuracy as Qwen3.6-35B roughly 30% faster and sits well ahead of Gemma 4 26B.

図に示すように、Nemotron 3.5 LightningはPinchBenchにおいて、同等の精度でタスクを完了する速度がQwen3.6-35Bより約30%速く、Gemma 4 26Bを大きく上回り、効率性の最前線に位置している。