10:15
官方账号arXiv cs.LG@Zewen Jin, Shen Fu, Zeping Duan, Shannon Wang, Weihao Wu, Chengjie Tang, Congkun Ai, Ping Gong, Zijian Dai, Youhui Bai, Cheng Li DeaMoE是一种解码高效混合专家架构,将专家按专业领域分组为部门,同部门专家共享大部分参数,并各自保留少量私有参数。它采用定制两阶段路由策略,避免冗余加载,大幅提升大模型解码效率。相比vanilla MoE,DeaMoE每步加载权重最多减少50.9%,7B模型在A40上端到端TPOT加速1.33倍。在微基准测试中,DeepSeek-V3在A40和H100上分别达到2.00倍和1.97倍的峰值加速。
推荐理由:DeaMoE让MoE小批量解码少搬权重、跑得更快,7B模型在A40上TPOT提速33%,DeepSeek-V3加速近2倍。