Batch-1の限界を追求:BlackwellにおけるLing-3.0-flashの投機的デコード最適化
Ling-3.0-flashハイブリッド線形アテンションMoEモデルを4枚のBlwell GPU上で最適化し、平均TPOT54%削減・単一リクエストスループット2.1倍向上を達成した技術的取り組みを解説する。
Ling-3.0-flashハイブリッド線形アテンションMoEモデルを4枚のBlwell GPU上で最適化し、平均TPOT54%削減・単一リクエストスループット2.1倍向上を達成した技術的取り組みを解説する。
QwenチームがマルチモーダルMoEモデル「Qwen3.8-Flash-Next」をオープンソース公開し、SGLangがQwen・NVIDIA・AMDチームと連携してDay-0サポートを提供した。本モデルはQwen4アーキテクチャの早期プレ
SGLangチームがNVIDIA Nemotron 3.5 Lightningモデルのゼロデイサポートを発表した。同モデルは常時稼働のエージェントシナリオ向けに設計され、高効率な推論ランタイムを通じて迅速なデプロイが可能となっている。
SpecForgeチームがv0.3.0をリリースし、ターゲットモデルの推論とドラフトモデルのトレーニングを完全に分離。オンライン・オフライン・デカップリングワークフローを統合し、より広範な推測デコードアルゴリズムをサポートする。
SGLangチームとMilesは、初のオープンソース3兆パラメータ級モデルであるKimi K3に対してDay-0サポートを正式に発表した。SGLangが推論を、MilesがRL学習を担当し、リリース日のあらゆるシナリオをカバーする。
Modal、Z Lab、SGLangチームが共同でDFlash投機的デコーディングモデルを発表し、SGLangの新デフォルトエンジンSpec V2と組み合わせることでLLM推論サービスの最適レイテンシを実現する。新たに公開されたQwen 3
SpecForgeチームが複数の業界パートナーと協力し、大規模データセットで訓練された本番環境対応のEAGLE-3モデルチェックポイント集「SpecBundle(Phase 1)」と、全面的に再構築されたSpecForge v0.2を発表。