#投机解码
共 19 条 · 7 天 3 条 · 30 天 3 条
信息流里打上「投机解码」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
10月7日
SecureSD:针对投机解码安全风险的防护方法
用小模型加速大模型推理的投机解码原来有安全漏洞,这篇论文定位到问题出在前几个 token,SecureSD 只需对早期 token 加严验证就能补上,做推理部署的可以看看。
10月6日
8月12日
8月11日
8月6日
SpecRoll:投机式 RL rollout 的快慢验证器反馈自适应
RL 训练嫌生成太慢?SpecRoll 用投机解码给 rollout 提速,不改采样分布,五个模型跑数学推理端到端快 1.2 倍以上,代码也开源了。
8月5日
8月4日
7月24日
Windowed-MTP:消除百万token上下文中的全上下文草稿KV负担
这篇论文解决了长上下文下投机解码的瓶颈,用滑动窗口草稿省掉99%的KV读取,实测速度提升近三成,而且不损失精度。搞大模型推理优化的值得看。
7月15日
7月12日
7月7日
7月2日
DeepSeek DSpark 投机解码原生集成 vLLM,性能提升显著
DeepSeek 把 DSpark 开源自带进 vLLM,跑 DeepSeek-V4 实测单卡 250 token/s,比 MTP 快 12-42%,想搞投机解码的可以试试。
6月29日
DeepSeek开源DSpark投机解码框架,推理提速60-85%
DeepSeek开源了DSpark框架,能让你的V4模型推理提速60%以上,且不影响质量。它解决了投机解码在真实部署中的难题,已经稳定跑在生产环境。
6月24日
DFlash投机解码:并行起草整块token,在Blackwell上吞吐量提升15倍
UC San Diego搞了个新方法DFlash,用扩散模型直接生成整段token,比自回归快几倍,Qwen3-8B上6倍加速,Blackwell上15倍,还开源了检查点,搞推理加速的可以看看。
6月23日
RLM-Cascade: 响应级投机解码代理层系统降低LLM API成本45.8%
这个系统把DeepSeek和Opus组合起来,用投机解码省了近一半API成本,还快了一倍,质量也有提升,而且开源可部署。
5月20日
Graft:剪枝+检索补偿,突破投机解码效率瓶颈
做推理加速的团队终于有了一个不牺牲接受率的剪枝方案——Graft用检索补偿剪枝损失,直接提升EAGLE-3 21.8%的加速比,搞LLM部署的值得试试。
5月14日
Qwen3.6 MTP GGUF 发布:27B 模型单 GPU 达 140 tokens/s
本地大模型性能天花板被再次抬高,玩 llama.cpp、跑本地 Agent 或日常 coding 的开发者可以直接用上,体验 30B+ 模型在消费级显卡上的流畅速度。