主要来源vLLM
查看原文事件专题 · 多源确认
vLLM 集成 DFlash 投机解码,Gemma-4 31B 吞吐量提升最高 5.8 倍
vLLM 项目宣布支持 DFlash 投机解码,用户只需将 EAGLE-3 检查点替换为 DFlash 检查点即可启用,无需修改代码。该功能通过开源 Speculators 库将 DFlash 草案模型与目标模型的隐藏状态连接。在单块 Blackwell Ultra GPU 上运行 Gemma-4 31B 模型,Math500 基准取得 5.8 倍吞吐量提升,GSM8K 提升 5.3 倍,HumanEval 提升 5.6 倍,MBPP 提升 4.4 倍。
当前结论
vLLM 和 NVIDIA 合作推出 DFlash 投机解码,Gemma-4 31B 推理速度提升近 6 倍,配置只需改一行 checkpoint 路径。
11 个信源66° AI 热度最后更新 2026/6/24 05:13:41
证据链
相关来源 1NVIDIA AI
查看原文相关来源 2LMSYS Org (SGLang)
查看原文相关来源 3marktechpost
查看原文相关来源 4Thomas Wolf
查看原文相关来源 5lmarena.ai
查看原文相关来源 6AI Will
查看原文相关来源 7AWS Machine Learning Blog
查看原文相关来源 8Viking
查看原文相关来源 9IT之家
查看原文相关来源 10techcrunch
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。