mixture-of-experts

general · 首次出现 2026-05-22 · 最近出现 2026-09-11 · 累计提及 162

综述

mixture-of-experts 近期进展

MoE 模型超参数高效迁移方法研究 arXiv cs.LG

  • 研究提出了一种高效的 MoE 模型超参数迁移方法,旨在加速模型训练过程。
  • Moonshot AI 开源 MoonEP:专为 MoE 训练设计的专家并行通信库 marktechpost

  • Moonshot AI 开源了 MoonEP,这是一个专为 MoE 训练设计的专家并行通信库,以优化并行计算。
  • CARE:自适应专家路由提升MoE-LoRA效率与OOD检测 arXiv cs.LG

  • CARE 方法通过自适应专家路由提高了 MoE-LoRA 的效率,并增强了开放域检测能力。
  • Kimi K3:2.8T参数开源MoE模型,性能接近Claude Fable 5和GPT-5.6 Sol arXiv cs.LG

  • Kimi K3 模型,拥有 2.8T 参数,是首个开源的 MoE 模型,其性能接近 Claude Fable 5 和 GPT-5.6 Sol。
  • 开源模型Laguna S 2.1发布:118B MoE,8B激活,1M上下文 elvis

  • Laguna S 2.1 模型,拥有 118B 参数,8B 激活,1M 上下文,是当前开源 MoE 模型中的佼佼者。
  • Thinking Machines Lab 发布 Inkling:975B 参数开源多模态 MoE,激活 41B 参数,可控思考努力 marktechpost

  • Inkling 模型,拥有 975B 参数,41B 激活,是首个开源的多模态 MoE 模型,支持可控思考努力。
  • Agents-A1:35B MoE智能体模型在长视野任务上媲美万亿参数性能 arXiv: DeepSeek

  • Agents-A1 模型,35B 参数,在长视野任务上展现出与万亿参数模型相当的性能。
  • CAEE: 成本感知的专家执行框架提升多设备MoE推理 arXiv: DeepSeek

  • CAEE 框架通过成本感知优化,提升了多设备 MoE 模型的推理效率。
  • SARA:通过语义锚定路由对齐解锁MoE多语言知识 arXiv cs.AI

  • SARA 方法通过语义锚定路由,增强了 MoE 模型在多语言知识处理上的能力。
  • Prime Intellect 发布 prime-rl 0.6.0,用于训练万亿参数 MoE 模型的智能体 RL marktechpost

  • Prime Intellect 发布了 prime-rl 0.6.0,这是一款用于训练万亿参数 MoE 模型的智能体强化学习工具。
  • 当前焦点与观察点

  • MoE 模型的研究和应用正日益增多,特别是在处理多模态数据和长文本方面。
  • 开源 MoE 模型的出现降低了研究门槛,促进了社区发展。
  • 模型性能与参数量之间的关系仍是一个活跃的研究领域。
  • MoE 模型的部署和推理效率是当前关注的重点。
  • 相关报道

    10 条在档