10:24官方一手arXiv: DeepSeek@Lie Li, Wen Li, Junxiao Shen, Gusheng Hu精选MAPLE是一个即插即用的MoE专家分配框架,可在不修改权重不重训练的前提下,按层重新分配路由专家预算。其核心是封闭式灵敏度引导分配,并用灵敏度约束的遗传搜索进一步优化。在DeepSeek-MoE-16B上,MAPLE仅用75%专家即在ARC-E上从65.09提升至71.40,ARC-C从48.49提升至51.50,BoolQ从80.03提升至82.38。通过SGLang部署,单GPU端到端延迟降低32.2%,吞吐量提升47.4%。AI模型MAPLEDeepSeek-MoE-16BSGLang推荐理由:MAPLE这个插件能让MoE大模型少开专家还更准,DeepSeek-MoE-16B用75%专家就能超原版,还快32%,不用改权重就能用。原文稍后读已读值得跟进有用关注 MAPLE
09:44官方一手arXiv: DeepSeek@Yongqin Zeng, Sicheng Pan, Jiale Wang, Hai-tao Zheng, Hong-Gee Kim, Chunxia Ma, XiuTeng Zhou该论文提出Generic TB-Coverage方法,仅使用WikiText2和C4两个通用语料进行校准。通过分别评估每个语料库上的专家效用并执行固定预算覆盖规则来构建剪枝掩码。在Qwen1.5-MoE-A2.7B和DeepSeek-MoE-16B-Base上,以25%、50%、75%的保留预算测试,六个零样本基准的平均准确率均优于随机剪枝、REAP和ExpertSparsity,同时WikiText2和C4的困惑度退化更小。在激进剪枝(25%和50%保留)下增益最为显著。论文MoE专家剪枝Qwen1.5-MoE推荐理由:这篇论文用两个通用语料就能做好MoE剪枝,在Qwen和DeepSeek模型上准确率更高,尤其适合需要极限压缩的场景。原文稍后读已读值得跟进有用关注 MoE