09:32官方一手arXiv: DeepSeek@Seungwoo Jung, Dohyeok Kwon, Seungmin Cha, Junseok Lee, Yeonho Yoo, Chuck Yoo, Gyeongsik Yang精选73°PARSER是一种新的残差稀疏化方法,用于压缩Mixture-of-Experts大模型。该方法通过引入输出重要性指标,将压缩目标从最小化孤立矩阵误差转变为保留专家输出误差。实验显示,在Qwen和DeepSeek模型上,PARSER将压缩后模型与未压缩模型之间的精度差距分别缩小1.41倍和1.44倍,同时实现了相同的峰值内存减少。论文MoEPARSERQwen推荐理由:PARSER方法解决了MoE模型压缩中误差累积问题,在相同内存减少下提升模型精度。原文稍后读已读值得跟进有用关注 MoE