AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
精选
AI 自动挑选的高价值内容
全部模型产品行业论文技巧
标签:剪枝×
5月20日
11:31
arXiv cs.LG@Yuhao Shen, Tianyu Liu, Xinyi Hu, Quan Kong, Baolin Zhang, Jun Dai, Jun Zhang, Shuang Ge, Lei Chen, Yue Li, Mingcheng Wan, Cong Wang
精选67
投机解码通过草稿-验证范式加速大模型推理,但现有方法构建的庞大草稿树带来严重的显存带宽和计算开销。动态深度剪枝虽能减少延迟,却会丢弃潜在有效候选,导致接受率无法达到稠密树的上限。本文提出Graft框架,将剪枝与检索作为相互增强的操作:剪枝释放计算预算,检索补偿剪枝导致的覆盖损失并恢复接受长度。Graft采用“先剪后接”机制,以近乎零开销将高预测性的检索令牌填入剪枝空位,无需训练且无损。在短上下文、长上下文及大规模模型(如Qwen3-235B)上,Graft实现了最高5.41倍加速,平均加速比EAGLE-3提升21.8%,并初步探索了在非自回归草稿范式中的应用。
论文投机解码推理加速剪枝检索补偿大模型部署

推荐理由:做推理加速的团队终于有了一个不牺牲接受率的剪枝方案——Graft用检索补偿剪枝损失,直接提升EAGLE-3 21.8%的加速比,搞LLM部署的值得试试。
5月18日
10:31
arXiv cs.LG@Gabriel Garcia
精选52
这篇论文发现,判断Transformer层是否“等价”时,常用的替换测试和交换测试会给出截然不同的结论。替换测试看一层能否替代另一层的位置,交换测试看两层互换后输出是否近似。在Pythia、Qwen3-8B和Llama-3.1-8B等模型上,两种测试的差距从训练初期到收敛逐渐扩大。例如Qwen3-8B在8B规模下,交换测试指导的剪枝比替换测试安全数倍,而Llama-3.1-8B两种测试的剪枝成本却相近。这意味着研究者不能只依赖单一指标判断层冗余,否则可能误判哪些层可以安全剪枝或合并。
论文模型压缩层等价性剪枝Qwen3-8BLlama-3.1-8B

推荐理由:做模型压缩或剪枝的团队,如果只用一种等价性测试就决定删层,可能会踩坑——这篇论文用Qwen3-8B和Llama-3.1-8B的对比告诉你,测试方法选错,安全剪枝的层数能差好几倍。建议在剪枝前先跑一下两种swap-KL诊断。