AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

DeepSeek-MoE-16B

共 2 条相关 AI 资讯
8月18日
10:24
10:24官方一手arXiv: DeepSeek@Lie Li, Wen Li, Junxiao Shen, Gusheng Hu
精选
MAPLE是一个即插即用的MoE专家分配框架,可在不修改权重不重训练的前提下,按层重新分配路由专家预算。其核心是封闭式灵敏度引导分配,并用灵敏度约束的遗传搜索进一步优化。在DeepSeek-MoE-16B上,MAPLE仅用75%专家即在ARC-E上从65.09提升至71.40,ARC-C从48.49提升至51.50,BoolQ从80.03提升至82.38。通过SGLang部署,单GPU端到端延迟降低32.2%,吞吐量提升47.4%。
AI模型MAPLEDeepSeek-MoE-16BSGLang

推荐理由:MAPLE这个插件能让MoE大模型少开专家还更准,DeepSeek-MoE-16B用75%专家就能超原版,还快32%,不用改权重就能用。
原文
7月3日
09:44
09:44官方一手arXiv: DeepSeek@Yongqin Zeng, Sicheng Pan, Jiale Wang, Hai-tao Zheng, Hong-Gee Kim, Chunxia Ma, XiuTeng Zhou
该论文提出Generic TB-Coverage方法,仅使用WikiText2和C4两个通用语料进行校准。通过分别评估每个语料库上的专家效用并执行固定预算覆盖规则来构建剪枝掩码。在Qwen1.5-MoE-A2.7B和DeepSeek-MoE-16B-Base上,以25%、50%、75%的保留预算测试,六个零样本基准的平均准确率均优于随机剪枝、REAP和ExpertSparsity,同时WikiText2和C4的困惑度退化更小。在激进剪枝(25%和50%保留)下增益最为显著。
论文MoE专家剪枝Qwen1.5-MoE

推荐理由:这篇论文用两个通用语料就能做好MoE剪枝,在Qwen和DeepSeek模型上准确率更高,尤其适合需要极限压缩的场景。
原文
精选全部日报登录