一种针对混合专家语言模型的专家剪枝方法 HOPE
研究团队提出的新方法 HOPE,通过考虑专家间的协同作用来优化混合专家语言模型的剪枝过程,在 122B 参数模型上测试,HOPE 在 50% 剪枝率下比 REAP 等方法性能更好,在代理任务上提升达 6.1%,证明了其有效性。
研究团队提出的新方法 HOPE,通过考虑专家间的协同作用来优化混合专家语言模型的剪枝过程,在 122B 参数模型上测试,HOPE 在 50% 剪枝率下比 REAP 等方法性能更好,在代理任务上提升达 6.1%,证明了其有效性。
做推理加速的团队终于有了一个不牺牲接受率的剪枝方案——Graft用检索补偿剪枝损失,直接提升EAGLE-3 21.8%的加速比,搞LLM部署的值得试试。
做模型压缩或剪枝的团队,如果只用一种等价性测试就决定删层,可能会踩坑——这篇论文用Qwen3-8B和Llama-3.1-8B的对比告诉你,测试方法选错,安全剪枝的层数能差好几倍。建议在剪枝前先跑一下两种swap-KL诊断。