论文精选72°10:33LightningLM 0.1V:单节点8卡训练120B稀疏MoE这篇论文解决了大模型训练资源门槛高的问题——单节点8卡就能训120B模型,做MoE和模型扩展的团队可以直接参考其状态保持原则和TQP策略,省下大量硬件成本。#稀疏MoE#模型扩展#可逆循环#低秩适配aarXiv cs.LG@Rohan Shravan原文稍后读已读值得跟进有用关注 稀疏MoE