09:41arXiv cs.AI@Mikołaj Zasada, Łukasz Struski, Jacek Tabor, Marcin KurdzielSoftMoE用截断的soft top-k LapSum松弛替换传统稀疏MoE的离散top-k路由,实现专家路由的可微分化。模型参数化每层平均激活专家数并施加全局预算,使容量分配可学习。在语言建模和下游任务上,SoftMoE性能与稀疏MoE相当或更优,但激活专家数量更少。实验显示分配呈高度非均匀性,后层激活更多专家。AI模型SoftMoEMoELLM专家混合可微路由推荐理由:稀疏MoE的top-k路由不灵活还浪费算力,SoftMoE用可微路由让模型自己学会少用专家,性能却不输,代码开源了。原文
10:12arXiv cs.AI@Fatema Siddika, Md Anwar Hossen, Tanwi Mallick, Ali Jannesari精选大型语言模型在持续学习中面临可塑性-稳定性困境,学习新任务常导致旧知识灾难性遗忘。现有方法统一处理参数,无法区分任务特定知识与共享能力。SETA框架通过自适应稀疏子空间分解,将知识分离为任务特定专家和共享专家,利用弹性锚定和路由正则化保护共享知识,统一门控网络自动检索正确专家组合。在LLaMA-2 7B和Qwen3-4B上的实验表明,SETA在多个领域基准上达到或超越现有方法,尤其擅长保留早期任务知识并改善反向迁移。论文持续学习灾难性遗忘专家混合LLM稀疏子空间推荐理由:SETA解决了LLM持续学习中任务知识冲突的核心痛点,做多任务模型训练或知识迁移的团队可以直接参考其专家分解思路,值得关注其稀疏子空间设计。原文