mixtureofexperts·general

mixture-of-experts

别名
首次出现
2026-05-22
最近出现
2026-07-24
累计提及
99
§ 01综述

混合专家(Mixture-of-Experts,MoE)是一种神经网络架构,通过稀疏激活多个专家子网络来扩展模型容量而不显著增加计算成本,近年来被广泛应用于大语言模型中以提升效率与性能。其核心思想是将输入仅路由到部分专家,从而在保持推理成本较低的同时扩大模型总参数量。

mixture-of-experts 近期进展

1. Inkling:975B参数开源多模态MoE

2026年7月,Thinking Machines Lab发布Inkling,一个975B参数的多模态MoE模型,推理时仅激活41B参数,并引入可控思考努力机制,允许用户权衡计算深度与延迟。该模型通过开源权重,推动MoE在视觉-语言任务中的可访问性。 原文标题

2. Agents-A1:35B MoE智能体模型匹敌万亿参数性能

来自DeepSeek的Agents-A1模型仅35B激活参数,在长视野智能体任务中表现与万亿参数稠密模型相当,验证了MoE在复杂规划与工具使用场景下的效率优势,为构建轻量智能体开辟新路径。 原文标题

3. Prime Intellect 发布 prime-rl 0.6.0,支持万亿参数MoE训练

该开源框架专门用于使用强化学习训练万亿参数MoE模型,降低大规模分布式训练门槛,使更多研究团队能够探索MoE与RL的协同优化。 原文标题

当前焦点与观察点

当前MoE研究的焦点集中在三个方向:一是扩大总参数规模(如Inkling的975B)同时优化激活效率;二是将MoE应用于智能体与多模态领域,利用稀疏激活降低推理成本;三是开发新型路由与训练框架(如CAEE、SARA、UniPool),以缓解专家负载不均衡、知识碎片化和多设备部署瓶颈。争议点在于,当模型达到万亿参数时,路由选择的质量与专家间的协作效率可能成为瓶颈,且过度稀疏可能导致部分专家欠学习。此外,MoE的推理部署在异构设备上仍需专用优化框架,成本感知调度(如CAEE)成为实用化关键。总体而言,MoE正从仅提升语言模型性能的“规模扩展器”演化为支撑智能体、多模态和高效推理的核心架构。
§ 02相关报道10 条在档
  1. 01
    开源模型Laguna S 2.1发布:118B MoE,8B激活,1M上下文
    elvis
  2. 02
    Thinking Machines Lab 发布 Inkling:975B 参数开源多模态 MoE,激活 41B 参数,可控思考努力
    marktechpost
  3. 03
    Agents-A1:35B MoE智能体模型在长视野任务上媲美万亿参数性能
    arXiv: DeepSeek
  4. 04
    CAEE: 成本感知的专家执行框架提升多设备MoE推理
    arXiv: DeepSeek
  5. 05
    SARA:通过语义锚定路由对齐解锁MoE多语言知识
    arXiv cs.AI
  6. 06
    Prime Intellect 发布 prime-rl 0.6.0,用于训练万亿参数 MoE 模型的智能体 RL
    marktechpost
  7. 07
    现代神经网络架构中的守恒定律统一框架
    arXiv cs.LG
  8. 08
    从自监督语音模型到混合专家:稳健的反欺骗
    arXiv cs.AI
  9. 09
    vLLM 日零支持 Cohere North Mini Code 模型
    vLLM
  10. 10
    MPI 方法重新设计 MoE 路由器:对齐专家主奇异方向
    arXiv cs.AI
§ 03邻近话题

本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

/topic/mixture-of-experts