11:49官方账号arXiv cs.LG@Yanhao Jia, Jiepeng Wang, Haibin Huang, Chi Zhang, Erik Cambria, Xuelong LiMMOE (ModernMOE) 是一种对SiT风格扩散Transformer的现代化改造,系统性地集成了路由专家、共享与轻量专家、门控残差路由及注意力残差信息复用。所有实验在单个8卡H100节点上以batch size 256训练40万步。在相同预算下,MMOE在每个记录检查点都达到更低的FID,即每训练步收敛更快,且优于密集和中等稀疏专家基线。路由分析显示专家在深度上稳定专业化,轻量路由被大量使用,去噪过程中步骤间的路由变化适度。这表明AIGC基础模型可以跟随LLM的平衡扩展路径,而不是简单地增加总参数量和稀疏比。AI模型MMOESiT扩散Transformer1 个信源在谈事件专题推荐理由:这篇论文把LLM里高效扩展的思路用到了扩散Transformer上,MMOE在单机8卡H100就跑出了更低的FID,比加参数更实用。原文稍后读已读值得跟进有用关注 MMOE
09:24官方账号arXiv cs.LG@Ruihang Li, Mengde Xu, Shuyang Gu, Leigang Qu, Fuli Feng, Han Hu, Wenjie Wang论文提出分布级奖励(Distribution-wise Rewards)框架,替代传统样本级奖励函数,以解决视觉生成中的奖励作弊和模式坍塌问题。通过子集替换策略降低计算成本,并应用强化学习优化模型合并系数,缓解训练-推理不一致。在SiT模型上FID-50K从8.30降至5.77,在EDM2模型上从3.74降至3.52。定性评估显示该方法在保持多样性的同时提升了感知质量。论文SiTEDM2分布奖励推荐理由:这篇论文提出用分布级奖励替代样本级奖励,解决了生成模型奖励作弊的老问题,SiT和EDM2的FID分数都显著提升。原文稍后读已读值得跟进有用关注 SiT