主要来源NVIDIA AI
查看原文事件专题 · 多源确认
DFlash开源块扩散模型,推理吞吐量提升15倍
NVIDIA发布DFlash,一种开源轻量级块扩散模型,专为投机解码设计。在NVIDIA Blackwell硬件上,DFlash可实现高达15倍的推理吞吐量提升,同时保持相同的用户交互响应速度。与传统逐token解码不同,DFlash一次生成整个token块,由主模型并行验证。该方案即插即用,已集成到SGLang、TensorRT-LLM和vLLM等框架中。
当前结论
NVIDIA开源了DFlash,用块扩散投机解码让Blackwell推理提速15倍,还支持SGLang和vLLM,随手就能用。
9 个信源48° AI 热度最后更新 2026/6/23 17:00:01
证据链
相关来源 1marktechpost
查看原文相关来源 2vLLM
查看原文相关来源 3lmarena.ai
查看原文相关来源 4LMSYS Org (SGLang)
查看原文相关来源 5IT之家
查看原文相关来源 6techcrunch
查看原文相关来源 7berryxia
查看原文相关来源 8AWS Machine Learning Blog
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。