#Mixture-of-Experts
共 8 条 · 7 天 1 条 · 30 天 4 条
信息流里打上「Mixture-of-Experts」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月10日
9月17日
提出无限参数LLM架构,可实时生成权重适应新数据
这个研究挺有意思的,作者想解决传统LLM在运行时无法学习新知识的问题,提出的无限参数架构挺有创意,通过实时生成权重来适应新数据,比单纯用提示词或检索的方法可能更高效。
一种针对混合专家语言模型的专家剪枝方法 HOPE
研究团队提出的新方法 HOPE,通过考虑专家间的协同作用来优化混合专家语言模型的剪枝过程,在 122B 参数模型上测试,HOPE 在 50% 剪枝率下比 REAP 等方法性能更好,在代理任务上提升达 6.1%,证明了其有效性。
9月11日
8月28日
8月21日
论文10:07
MoE 模型超参数高效迁移方法研究研究人员提出了一种方法,能通过小模型实验,准确预测万亿 token 规模 MoE 模型的最优学习率,省去了大量计算成本。他们用 155B 参数的模型验证了方法的有效性。
6月17日
6月15日