主要来源marktechpost
查看原文事件专题 · 官方一手
DFlash投机解码:并行起草整块token,在Blackwell上吞吐量提升15倍
UC San Diego推出DFlash,用轻量级块扩散模型替代自回归起草器,实现投机解码。该方法通过单次前向传播生成整块token,并利用KV注入条件于目标隐藏特征。在Qwen3-8B上达到6.08倍无损加速,NVIDIA报告在Blackwell上固定交互性下吞吐量提升15倍。DFlash已发布20个检查点,支持SGLang、vLLM和TensorRT-LLM。
当前结论
UC San Diego搞了个新方法DFlash,用扩散模型直接生成整段token,比自回归快几倍,Qwen3-8B上6倍加速,Blackwell上15倍,还开源了检查点,搞推理加速的可以看看。
9 个信源76° AI 热度最后更新 2026/6/24 07:21:10
证据链
相关来源 1NVIDIA AI
查看原文相关来源 2vLLM
查看原文相关来源 3LMSYS Org (SGLang)
查看原文相关来源 4AWS Machine Learning Blog
查看原文相关来源 5IT之家
查看原文相关来源 6lmarena.ai
查看原文相关来源 7berryxia
查看原文相关来源 8Fireworks AI
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。