11:49官方账号arXiv cs.LG@Yanhao Jia, Jiepeng Wang, Haibin Huang, Chi Zhang, Erik Cambria, Xuelong LiMMOE (ModernMOE) 是一种对SiT风格扩散Transformer的现代化改造,系统性地集成了路由专家、共享与轻量专家、门控残差路由及注意力残差信息复用。所有实验在单个8卡H100节点上以batch size 256训练40万步。在相同预算下,MMOE在每个记录检查点都达到更低的FID,即每训练步收敛更快,且优于密集和中等稀疏专家基线。路由分析显示专家在深度上稳定专业化,轻量路由被大量使用,去噪过程中步骤间的路由变化适度。这表明AIGC基础模型可以跟随LLM的平衡扩展路径,而不是简单地增加总参数量和稀疏比。AI模型MMOESiT扩散Transformer1 个信源在谈事件专题推荐理由:这篇论文把LLM里高效扩展的思路用到了扩散Transformer上,MMOE在单机8卡H100就跑出了更低的FID,比加参数更实用。原文稍后读已读值得跟进有用关注 MMOE
09:41官方账号arXiv cs.AI@Mikołaj Zasada, Łukasz Struski, Jacek Tabor, Marcin KurdzielSoftMoE用截断的soft top-k LapSum松弛替换传统稀疏MoE的离散top-k路由,实现专家路由的可微分化。模型参数化每层平均激活专家数并施加全局预算,使容量分配可学习。在语言建模和下游任务上,SoftMoE性能与稀疏MoE相当或更优,但激活专家数量更少。实验显示分配呈高度非均匀性,后层激活更多专家。AI模型SoftMoEMoELLM推荐理由:稀疏MoE的top-k路由不灵活还浪费算力,SoftMoE用可微路由让模型自己学会少用专家,性能却不输,代码开源了。原文稍后读已读值得跟进有用关注 SoftMoE
10:12官方账号arXiv cs.AI@Fatema Siddika, Md Anwar Hossen, Tanwi Mallick, Ali Jannesari精选大型语言模型在持续学习中面临可塑性-稳定性困境,学习新任务常导致旧知识灾难性遗忘。现有方法统一处理参数,无法区分任务特定知识与共享能力。SETA框架通过自适应稀疏子空间分解,将知识分离为任务特定专家和共享专家,利用弹性锚定和路由正则化保护共享知识,统一门控网络自动检索正确专家组合。在LLaMA-2 7B和Qwen3-4B上的实验表明,SETA在多个领域基准上达到或超越现有方法,尤其擅长保留早期任务知识并改善反向迁移。论文持续学习灾难性遗忘专家混合推荐理由:SETA解决了LLM持续学习中任务知识冲突的核心痛点,做多任务模型训练或知识迁移的团队可以直接参考其专家分解思路,值得关注其稀疏子空间设计。原文稍后读已读值得跟进有用关注 持续学习