11:31官方账号arXiv cs.LG@Tianyi Li, Yaxin Luo, Xinyi Shang, Zhiqiang ShenDARTree是一种免训练的推测性解码方法,将预训练的自回归修正头从链式扩展为树结构,以加速大语言模型推理。它通过批量扩展和评分构建固定宽度的候选树,再经最佳优先剪枝选出验证树,无需顺序堆操作。在七个数学、代码和聊天基准上,DARTree在全部四种模型-温度配置中取得最高平均接受长度和加速比,单轮验证最多接受12.97个token,比DFlash高98.6%,比Domino高27.9%,相比本地自回归解码实现最高9.73倍无损加速。论文DARTree推测解码扩散模型推荐理由:这论文搞了个叫DARTree的采样方法,不用训练就能让模型跑得更快,最多比原来快9倍多,数学和代码任务上都有效。原文稍后读已读值得跟进有用关注 DARTree