#推测解码
AsymSpec通过非对称上下文访问,实现了推理加速,准确率高达90%,计算成本降低,值得一看。
腾讯刚开源了AngelSpec,一个统一训练推测解码草稿模型的框架。它带的DFly块扩散器能让HY3模型推理快最多2.4倍,还支持六种架构,实用性强。
OpenAI 搞了个新模型 GPT-5.6 Sol,能自己优化自己,部署后服务成本直接降了20%,生成速度还快了15%,搞推理服务的值得关注。
vLLM新版本把Model Runner V2设成了默认,推理更快更稳,还新增了流解析和推测解码,想优化部署性能的话可以关注。
SGLang加入DSpark后,高并发场景下吞吐能提升20%,在DeepSeek-V4上实测383.7 tok/s,推理优化党可以试试。
LMSYS 和 Modal 联手推出了 DFlash,让 Qwen 3.5 的推理速度比原生 MTP 快 1.5 倍,比基线快 4.3 倍,代码已开源,玩起来!
扩散模型推理加速有了新解法——块验证让草稿接受率更高,做生成式 AI 推理优化的团队可以直接参考 Free Drafter 的无训练方案,实测有 6.3% 的提速收益。
RL 训练加速是 LLM 后训练的核心痛点,Bebop 用 MTP+拒绝采样把加速做到 1.8 倍,做 RL 训练优化的团队可以直接参考其 TV 损失和离线训练策略。
做LLM推理加速的团队终于有了一个能动态分配验证资源的方案——在智能体工作流中平均加速2.73倍,比EAGLE3还强,搞推测解码的开发者值得点开看看具体实现。
这一工作展示了扩散式推测解码在TPU上的实际落地价值,突破传统推测解码的顺序瓶颈,尤其利好大规模LLM推理场景。开源集成至vLLM有助于行业快速采用。
该工作直接解决字节级LLM的核心效率瓶颈,提出的混合推理策略(扩散+推测解码)为无分词器模型走向实际应用提供了可行路径。