#DFlash
共 5 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「DFlash」标签的资讯、产品与论文,按刊登时间排,新的在上。
6月26日
6月24日
DFlash投机解码:并行起草整块token,在Blackwell上吞吐量提升15倍
UC San Diego搞了个新方法DFlash,用扩散模型直接生成整段token,比自回归快几倍,Qwen3-8B上6倍加速,Blackwell上15倍,还开源了检查点,搞推理加速的可以看看。
vLLM 集成 DFlash 投机解码,Gemma-4 31B 吞吐量提升最高 5.8 倍
vLLM 和 NVIDIA 合作推出 DFlash 投机解码,Gemma-4 31B 推理速度提升近 6 倍,配置只需改一行 checkpoint 路径。
6月16日
DFlash + Spec V2 推测解码:LLM推理吞吐量提升4.3倍以上
LMSYS 和 Modal 联手推出了 DFlash,让 Qwen 3.5 的推理速度比原生 MTP 快 1.5 倍,比基线快 4.3 倍,代码已开源,玩起来!