11:45官方账号arXiv cs.AI@Simeng Sun, Roger Waleffe73°研究人员提出通信高效专家混合模型(CE-MoE),采用异构层模式解耦令牌混合和通道混合深度。在2B至31.5B参数规模测试中,CE-MoE模型在匹配总参数和激活参数的情况下,减少了33.3%的GPU训练时间,同时保持验证损失和下游基准性能与全MoE基线相当。31.5B规模时,CE-MoE还提升了平均下游分数和推理吞吐量。论文MoECE-MoE专家混合推荐理由:新方法让31.5B参数模型训练省1/3时间,性能还更好,适合大规模MoE模型训练。原文稍后读已读值得跟进有用关注 MoE