模型精选10:24MAPLE:MoE模型自适应分层专家分配,75%专家超越原版MAPLE这个插件能让MoE大模型少开专家还更准,DeepSeek-MoE-16B用75%专家就能超原版,还快32%,不用改权重就能用。#MAPLE#DeepSeek-MoE-16B#SGLang#MoEaarXiv: DeepSeek@Lie Li 等 4 人原文稍后读已读值得跟进有用关注 MAPLE
论文09:44Generic TB-Coverage:MoE语言模型的覆盖感知专家剪枝这篇论文用两个通用语料就能做好MoE剪枝,在Qwen和DeepSeek模型上准确率更高,尤其适合需要极限压缩的场景。#MoE#专家剪枝#Qwen1.5-MoE#DeepSeek-MoE-16BaarXiv: DeepSeek@Yongqin Zeng 等 7 人原文稍后读已读值得跟进有用关注 MoE