レビュー Batch-1の限界を追求:BlackwellにおけるLing-3.0-flashの投機的デコード最適化 Ling-3.0-flashハイブリッド線形アテンションMoEモデルを4枚のBlwell GPU上で最適化し、平均TPOT54%削減・単一リクエストスループット2.1倍向上を達成した技術的取り組みを解説する。 LMSYS AI推理优化 推测解码 Blackwell GPU 2026年8月29日 229