16:39官方账号Latent Space (swyx)(博客/媒体)本期AINews探讨了通过投机解码技术窃取推理模型思维链的方法。文章指出,投机解码不仅能加速推理,还能被用来提取模型的内部推理过程。这种技术可能对模型安全构成威胁,因为推理轨迹包含敏感信息。文章还讨论了蒸馏与推理轨迹窃取之间的界限。论文投机解码推理轨迹模型安全推荐理由:想知道怎么从推理模型里偷思维链?这篇讲透了投机解码的另类用法,安全研究者必看。原文稍后读已读值得跟进有用关注 投机解码
11:16官方账号arXiv cs.AI@Nathan Godey, Yoav Artzi精选Matryoshka训练框架将500M、1.5B和3B三个子模型堆叠进单一嵌套架构,端到端训练。相比独立训练基线,该套件在基准性能和困惑度上持平,但训练计算量减少36%。嵌套结构天然支持投机解码,吞吐量提升14-26%。论文还消融了关键架构选择,为构建强Matryoshka套件提供指导。论文Matryoshka语言模型训练效率推荐理由:想省训练算力又不想掉性能?这个嵌套训练法把三个模型塞一个架构里,直接省36%算力,还顺带加速推理,值得一看。原文稍后读已读值得跟进有用关注 Matryoshka
10:02官方账号arXiv cs.LG@Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo, Vinh Van Nguyen, Khac-Hoai Nam Bui精选SpecRoll 是一种用于强化学习 rollout 的投机解码引擎,面向大规模语言模型后训练。它用轻量级未来 token 头生成并行提议,并通过 Reflex 模块做轨迹局部的隐藏状态修正,无需反向传播。在 1.5B 到 14B 的五个模型和三个数学推理数据集上,SpecRoll 相比原始 GRPO 取得 1.26-2.15 倍生成加速和 1.21-2.04 倍端到端加速。在全部 15 组匹配设置中,SpecRoll 的平均端到端耗时比 FastGRPO 快 1.18 倍。源码已公开。论文SpecRollGRPO投机解码推荐理由:RL 训练嫌生成太慢?SpecRoll 用投机解码给 rollout 提速,不改采样分布,五个模型跑数学推理端到端快 1.2 倍以上,代码也开源了。原文稍后读已读值得跟进有用关注 SpecRoll
10:06官方一手arXiv: DeepSeek@Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang KangApproximate Speculative Decoding(ASD)是一种免训练的投机解码验证器,用预算化的最长前缀选择替代逐位截断,在保留目标贪心后缀的同时接受部分不匹配token。在Qwen3-14B+DSpark-14B的七项任务上,ASD相比严格验证平均提升7.78%吞吐,区间为3.05%到15.26%。在FP4到FP8兼容设置下,DeepSeek-V4-Flash(284B)搭配DSpark时,GSM8K和MATH-500上的验证方接受率提高约10%到16%。该方法无需新草稿模型或微调,预算为零时精确退化为标准贪心验证,代码已开源。论文ASD投机解码Qwen3-14B7 个信源在谈事件专题推荐理由:这篇论文搞了个叫ASD的投机解码改进,不用重新训练就能提速,实测吞吐最高涨15%,代码也开源了,跑推理的可以看看。原文稍后读已读值得跟进有用关注 ASD
06:38Latent.Space@latentspacepod精选在latent.space的推理工程大师课中,Baseten的Philip Kiely与@waterloo_intern讲解了模型训练后如何变成快速可靠的产品。他们指出量化误差可以相互抵消,从而解锁更高吞吐量。推理团队目前仍能挖掘20%–200%的性能增益。视频生成面临二次注意力扩展的瓶颈。GLM-5.2还使用自身重写并优化了服务自己的GPU内核。技巧GLM-5.2Baseten推理优化推荐理由:Baseten工程师讲推理优化,量化误差能抵消,GLM-5.2自己优化自己,还有20-200%提速空间。原文稍后读已读值得跟进有用关注 GLM-5.2
11:54官方账号arXiv cs.LG@Alagappan Valliappan针对百万token上下文场景,论文指出原生MTP草稿头因全面注意力机制导致KV缓存读取随上下文线性增长,抵消了投机解码的加速优势。作者提出Windowed-MTP方法,仅对草稿注意力层应用StreamingLLM式滑动窗口加注意力汇聚,将草稿KV工作集限制为常数,在1M上下文中丢弃约99%的KV条目。在Qwen GDN-MoE 35B/122B和Mamba2-hybrid NoPE 120B三类架构、单GPU SGLang环境下,每步解码成本比原生MTP降低28%-44%,且不改变目标模型输出分布。该方法无需训练、即插即用,并可回收未读取的草稿KV(1M时占总KV的7.7%-11%)。论文Windowed-MTP投机解码KV缓存推荐理由:这篇论文解决了长上下文下投机解码的瓶颈,用滑动窗口草稿省掉99%的KV读取,实测速度提升近三成,而且不损失精度。搞大模型推理优化的值得看。原文稍后读已读值得跟进有用关注 Windowed-MTP
09:46官方一手arXiv: DeepSeek@Jincheng Xie, Runheng Liu, Heyan Huang, Yawen Ling, Hanbin Dai, Yu Zheng, Wen Hu精选稀疏混合专家(MoE)模型在扩展LLM时依赖专家激活模式,现有投机解码忽视专家激活成本,导致专家散射增加内存流量。EcoSpec通过轻量级专家预测器和动态专家缓冲区,在保持高接受率前提下优先复用了当前验证集的专家路径。在DeepSeek-V3.1(671B)、Qwen3-235B-A22B、GPT-OSS-120B三个大规模MoE模型上,于推理、编码、问答和对话基准测试中,EcoSpec持续减少活跃专家足迹,最高实现1.62倍解码速度提升。论文EcoSpecMoE投机解码推荐理由:这篇论文提出EcoSpec,在DeepSeek-V3.1等MoE模型上通过成本感知投机解码最高提速1.62倍,值得关注。原文稍后读已读值得跟进有用关注 EcoSpec
20:29官方账号vLLM@vllm_project精选72°Cohere 团队开发了硬件感知的动态投机解码(Dynamic SD)并合并到 vLLM 项目。传统方法使用固定数量的草稿 token,而 DSD 会根据批次大小和硬件自适应调整。在有利场景下实现加速,在不利场景下回退以保持性能。该更新提升了 vLLM 在推理时的效率。AI模型CoherevLLMDynamic SD推荐理由:vLLM 合并了 Cohere 的动态投机解码,能根据硬件和批次大小自适应,想提升推理速度的可以试试。原文稍后读已读值得跟进有用关注 Cohere
11:49官方一手arXiv: DeepSeek@Xin Cheng, Xingkai Yu, Chenze Shao, Jiashi Li, Yunfan Xiong, Yi Qian, Jiaqi Zhu, Shirong Ma, Xiaokang Zhang, Jiasheng Ye, Qinyu Chen, Chengqi Deng, Jiping Yu, Damai Dai, Zhengyan Zhang, Yixuan Wei, Yixuan Tan, Wenkai Yang, Runxin Xu, Yu Wu, Zhean Xu, Xuanyu Wang, Muyang Chen, Rui Tian, Xiao Bi, Zhewen Hao, Shaoyuan Chen, Huanqi Cao, Wentao Zhang, Anyi Xu, Huishuai Zhang, Dongyan Zhao, Wenfeng Liang76°DSpark是一种新型投机解码框架,通过半自回归架构(并行骨干网络+轻量级顺序模块)保持草稿质量,缓解后缀衰减。它采用置信度调度验证,根据前缀存活概率和引擎吞吐量动态调整每轮验证长度。在离线多领域基准测试中,DSpark的接受长度显著优于现有自回归和平行草稿器。在DeepSeek-V4服务系统的真实用户流量下,相比生产基线MTP-1,DSpark在维持吞吐量不变时单用户生成速度提升60%至85%。DSpark还通过防止高并发下吞吐量严重退化,使服务系统达到了此前无法实现的性能层级。AI模型DSparkDeepSeek-V4投机解码推荐理由:DeepSeek-V4搞了个新框架DSpark,把生成和验证分开调度,用户实际体验加速60%到85%,还不会拖慢系统吞吐。原文稍后读已读值得跟进有用关注 DSpark
20:30官方账号vLLM@vllm_project精选DeepSeek 的 DSpark 投机解码技术现已原生集成到 vLLM 推理框架中。DSpark 是一种半自回归草稿模型,通过非因果滑动窗口注意力并行生成多个 token,单次验证即可保持输出一致,减少解码步数。在 NVIDIA 8×B300 GPU 上,DeepSeek-V4-Pro-DSpark 在 batch size 1 时达到约 250 tokens/s,平均接受长度约 5,且在不同草稿深度下比 MTP 方法接受率高 12-42%。vLLM 通过复用 SparseMLA 后端、捕获完整草稿主干和采样循环到单一 CUDA graph,并支持前缀缓存和 FP8 KV cache。AI模型DeepSeekvLLMDSpark8 个信源在谈事件专题推荐理由:DeepSeek 把 DSpark 开源自带进 vLLM,跑 DeepSeek-V4 实测单卡 250 token/s,比 MTP 快 12-42%,想搞投机解码的可以试试。原文稍后读已读值得跟进有用关注 DeepSeek
00:21berryxia@berryxia精选73°DeepSeek开源了DSpark投机解码框架,用于推理优化。DSpark通过并行backbone加顺序Markov head解决传统投机解码的后缀衰减问题,并引入置信度调度和负载感知调度器。在DeepSeek-V4生产环境中,单用户生成速度比MTP-1基线快60-85%,不同场景吞吐提升1.5x到5x。开源内容包括DeepSeek-V4-Pro-DSpark和DeepSeek-V4-Flash-DSpark模型checkpoint以及MIT协议的DeepSpec训练代码。AI模型DeepSeekDSparkDeepSeek-V4推荐理由:DeepSeek开源了DSpark框架,能让你的V4模型推理提速60%以上,且不影响质量。它解决了投机解码在真实部署中的难题,已经稳定跑在生产环境。原文稍后读已读值得跟进有用关注 DeepSeek
15:30官方一手marktechpost@Asif Razzaq76°UC San Diego推出DFlash,用轻量级块扩散模型替代自回归起草器,实现投机解码。该方法通过单次前向传播生成整块token,并利用KV注入条件于目标隐藏特征。在Qwen3-8B上达到6.08倍无损加速,NVIDIA报告在Blackwell上固定交互性下吞吐量提升15倍。DFlash已发布20个检查点,支持SGLang、vLLM和TensorRT-LLM。AI模型DFlashQwen3-8BNVIDIA Blackwell8 个信源在谈事件专题推荐理由:UC San Diego搞了个新方法DFlash,用扩散模型直接生成整段token,比自回归快几倍,Qwen3-8B上6倍加速,Blackwell上15倍,还开源了检查点,搞推理加速的可以看看。原文稍后读已读值得跟进有用关注 DFlash
03:18官方账号NVIDIA AI@NVIDIAAI精选NVIDIA发布DFlash,一种开源轻量级块扩散模型,专为投机解码设计。在NVIDIA Blackwell硬件上,DFlash可实现高达15倍的推理吞吐量提升,同时保持相同的用户交互响应速度。与传统逐token解码不同,DFlash一次生成整个token块,由主模型并行验证。该方案即插即用,已集成到SGLang、TensorRT-LLM和vLLM等框架中。AI模型DFlashNVIDIABlackwell8 个信源在谈事件专题推荐理由:NVIDIA开源了DFlash,用块扩散投机解码让Blackwell推理提速15倍,还支持SGLang和vLLM,随手就能用。原文稍后读已读值得跟进有用关注 DFlash
12:04官方一手arXiv: DeepSeek@Haifeng Wu, Srinivasan Manoharan, Fangbo Tu, Junhua Zhao, Jian Wan精选RLM-Cascade是一个代理层投机解码系统,在响应级别优化LLM API调用。它使用DeepSeek作为草稿模型、Opus作为验证模型,并通过轻量复杂度路由器选择路径。在Claude Code生产环境中,系统达到88.8%的草稿使用率,API成本相比直接使用Opus降低45.8%。P50延迟从3698毫秒降至2026毫秒,实现1.83倍加速。在20个Code/Math/Instruct任务基准上,RLM-Cascade通过率达100%,高于Opus的95%。AI模型RLM-CascadeDeepSeekOpus推荐理由:这个系统把DeepSeek和Opus组合起来,用投机解码省了近一半API成本,还快了一倍,质量也有提升,而且开源可部署。原文稍后读已读值得跟进有用关注 RLM-Cascade
11:31官方账号arXiv cs.LG@Yuhao Shen, Tianyu Liu, Xinyi Hu, Quan Kong, Baolin Zhang, Jun Dai, Jun Zhang, Shuang Ge, Lei Chen, Yue Li, Mingcheng Wan, Cong Wang精选投机解码通过草稿-验证范式加速大模型推理,但现有方法构建的庞大草稿树带来严重的显存带宽和计算开销。动态深度剪枝虽能减少延迟,却会丢弃潜在有效候选,导致接受率无法达到稠密树的上限。本文提出Graft框架,将剪枝与检索作为相互增强的操作:剪枝释放计算预算,检索补偿剪枝导致的覆盖损失并恢复接受长度。Graft采用“先剪后接”机制,以近乎零开销将高预测性的检索令牌填入剪枝空位,无需训练且无损。在短上下文、长上下文及大规模模型(如Qwen3-235B)上,Graft实现了最高5.41倍加速,平均加速比EAGLE-3提升21.8%,并初步探索了在非自回归草稿范式中的应用。论文投机解码推理加速剪枝推荐理由:做推理加速的团队终于有了一个不牺牲接受率的剪枝方案——Graft用检索补偿剪枝损失,直接提升EAGLE-3 21.8%的加速比,搞LLM部署的值得试试。原文稍后读已读值得跟进有用关注 投机解码
16:33berryxia@berryxiaUnslothAI 创始人 Daniel Han 发布了 Qwen3.6 的实验性 MTP GGUF 版本,通过投机解码技术大幅提升推理速度。27B 模型在单 GPU 上达到 140 tokens/s,35B-A3B 版本更达 220 tokens/s,比原版 GGUF 快 1.4 倍且精度无损。最佳 draft tokens 设为 2,过高会导致接受率下降。这一突破显著提升了本地大模型的性能上限,让消费级显卡能更高效运行 30B+ 参数模型。AI模型Qwen3.6GGUF投机解码推荐理由:本地大模型性能天花板被再次抬高,玩 llama.cpp、跑本地 Agent 或日常 coding 的开发者可以直接用上,体验 30B+ 模型在消费级显卡上的流畅速度。原文稍后读已读值得跟进有用关注 Qwen3.6