dflash·general

DFlash

别名
首次出现
2026-05-22
最近出现
2026-07-16
累计提及
24
§ 01综述

DFlash是一种扩散式推测解码(speculative decoding)框架,通过并行生成多个候选token块来加速大语言模型的推理过程,其核心思想是让一个小模型草稿器一次性预测整块token,再经目标模型验证,从而在NVIDIA Blackwell、Google TPU等硬件上实现数倍吞吐量提升。

DFlash 近期进展

  • NVIDIA AI 开源 DFlash 块扩散模型,在 Blackwell 架构上实现推理吞吐量提升15倍,该技术通过并行起草整个token块并利用扩散过程加速验证,显著降低了串行解码的延迟。原文标题
  • vLLM 集成 DFlash 投机解码,在 Gemma-4 31B 模型上吞吐量提升最高5.8倍,表明 DFlash 能与主流推理框架无缝结合,为实际部署提供即插即用加速。原文标题
  • LMSYS Org (SGLang) 通过 DFlash + Spec V2 实现 4.3 倍吞吐提升,展示了 DFlash 在不同推测解码策略下均能有效工作,进一步验证了其通用性。原文标题
  • UCSD 在 Google TPU 上实现 3 倍 LLM 推理加速,采用 DFlash 风格的扩散式推测解码,证明该技术不局限于特定硬件,可跨平台推广。原文标题
  • 当前焦点与观察点

    DFlash 的快速普及得益于其简洁高效的“并行草稿+验证”机制,解决了传统推测解码因串行草稿而受限的瓶颈。当前焦点集中于:一是与各大推理框架(vLLM、SGLang)及硬件(Blackwell、TPU)的原生集成,降低使用门槛;二是针对不同模型规模(如31B、V4)的调优,例如 HyperDFlash 专门为 DeepSeek-V4 进行 MHC 对齐优化。值得关注的是,DFlash 的单次验证开销可能随块大小增大而增加,如何在吞吐与延迟之间取得最佳平衡仍是实际部署的关键。此外,端侧推理场景也出现了初步尝试(如 oMLX 集成),但受限于内存和算力,DFlash 的高并行优势在移动设备上可能减弱。总体而言,DFlash 已成为加速 LLM 推理的重要方向之一,其开源生态和跨平台适配能力将决定其能否持续引领解码效率提升。

    § 02相关报道10 条在档
    1. 01
      thinkymachines开源Inkling:975B总参/41B激活MoE,1M上下文多模态
      LMSYS Org (SGLang)
    2. 02
      vLLM v0.25.0发布:Model Runner V2默认,新增统一流解析引擎
      vLLM
    3. 03
      DeepSeek开源DSpark推测解码框架,加速V4生成60-85%
      marktechpost
    4. 04
      北大与DeepSeek开源DSpark推理加速框架,速度提升60%-85%
      IT之家
    5. 05
      HyperDFlash: 面向DeepSeek-V4的MHC对齐块推测解码
      arXiv: DeepSeek
    6. 06
      DFlash投机解码:并行起草整块token,在Blackwell上吞吐量提升15倍
      marktechpost
    7. 07
      vLLM 集成 DFlash 投机解码,Gemma-4 31B 吞吐量提升最高 5.8 倍
      vLLM
    8. 08
      DFlash开源块扩散模型,推理吞吐量提升15倍
      NVIDIA AI
    9. 09
      DFlash + Spec V2 推测解码:LLM推理吞吐量提升4.3倍以上
      LMSYS Org (SGLang)
    10. 10
      oMLX 0.3.9.dev2 更新:苹果端侧 AI 速度集成度再升级
      berryxia
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/DFlash