Batch-1の限界を追求:BlackwellにおけるLing-3.0-flashの投機的デコード最適化
Ling-3.0-flashハイブリッド線形アテンションMoEモデルを4枚のBlwell GPU上で最適化し、平均TPOT54%削減・単一リクエストスループット2.1倍向上を達成した技術的取り組みを解説する。
Ling-3.0-flashハイブリッド線形アテンションMoEモデルを4枚のBlwell GPU上で最適化し、平均TPOT54%削減・単一リクエストスループット2.1倍向上を達成した技術的取り組みを解説する。
QwenチームがマルチモーダルMoEモデル「Qwen3.8-Flash-Next」をオープンソース公開し、SGLangがQwen・NVIDIA・AMDチームと連携してDay-0サポートを提供した。本モデルはQwen4アーキテクチャの早期プレ
SGLangチームがNVIDIA Nemotron 3.5 Lightningモデルのゼロデイサポートを発表した。同モデルは常時稼働のエージェントシナリオ向けに設計され、高効率な推論ランタイムを通じて迅速なデプロイが可能となっている。
SpecForgeチームがv0.3.0をリリースし、ターゲットモデルの推論とドラフトモデルのトレーニングを完全に分離。オンライン・オフライン・デカップリングワークフローを統合し、より広範な推測デコードアルゴリズムをサポートする。
SGLangチームとMilesは、初のオープンソース3兆パラメータ級モデルであるKimi K3に対してDay-0サポートを正式に発表した。SGLangが推論を、MilesがRL学習を担当し、リリース日のあらゆるシナリオをカバーする。
Modal、Z Lab、SGLangチームが共同でDFlash投機的デコーディングモデルを発表し、SGLangの新デフォルトエンジンSpec V2と組み合わせることでLLM推論サービスの最適レイテンシを実現する。新たに公開されたQwen 3
Googleが新たにオープンソース化したGemma 4モデルは、投機的デコードと疎なエキスパート混合(MoE)アーキテクチャの統合により、出力品質を損なうことなく最大3倍の推論高速化を実現しました。これにより、低コストAIサービスに新たなイ