レビュー 次世代投機的デコーディング:DFlashとSpec V2 Modal、Z Lab、SGLangチームが共同でDFlash投機的デコーディングモデルを発表し、SGLangの新デフォルトエンジンSpec V2と組み合わせることでLLM推論サービスの最適レイテンシを実現する。新たに公開されたQwen 3 LMSYS 推测解码 DFlash SGLang 2026年6月29日 294
レビュー 研究から本番環境へ:EAGLE-3がVertex AIでオープンソースLLMの推論を2-3倍高速化 EAGLE-3は軽量なdraft headを使用してLLMの推論を2-3倍高速化する技術で、Vertex AIでの本番環境での実装における技術的課題と解決策を紹介。 LMSYS EAGLE-3 Speculative Decoding Vertex AI 2026年2月4日 1,005