AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

路由机制

共 5 条相关 AI 资讯
8月11日
10:47
10:47官方一手arXiv: DeepSeek@Zongfei Li
精选
一项新研究质疑稀疏MoE路由器中专家选择与输出加权是否应使用相同分数。在预训练的OLMoE-1B-7B上,仅改变集合内聚合方式,结构化oracle将全周期交叉熵提升0.0160±0.0039。研究者训练了301K参数的FDAA后处理头,在冻结主干、路由器和专家的情况下,将WikiText-103测试集Delta CE提升至-0.1523±0.0031。在DeepSeek-V2-Lite上复现固定调度审计,路由器Top1识别最佳选中专家的比例仅为12.5%和16.7%。结果表明专家选择与专家承诺应跨架构区分。
论文MoEOLMoEDeepSeek-V2-Lite

推荐理由:这篇论文用OLMoE和DeepSeek-V2-Lite实测证明,MoE路由的选专家和加权输出不该共用一套分数,FDAA方法能白捡性能提升,做MoE优化的值得看。
原文
8月4日
11:58
11:58官方账号arXiv cs.LG@Tom Saliencro, Rohan Desai, Priya Nair, Maya Lindqvist, Daniel Whitmore
VI-MoLE提出将混合LoRA专家路由视为认证信息价值分配问题。该方法在验证集上为每个专家前缀后的反事实风险输出同时有效的上界证书,并依据单位成本的边际风险降低量分配全局适配器预算。与仅依赖不确定性的动态路由不同,VI-MoLE能区分可恢复风险与残余歧义。论文在匹配计算量准确率、证书覆盖率、风险-覆盖率、分布偏移和尾延迟上与固定及动态MoE-LoRA路由对比。实验设置来自arXiv 2608.02528v1。
论文LoRAVI-MoLEMoE

推荐理由:这论文把“不确定就多算”的LoRA路由换成了信息价值定价,能证明预算花在哪风险降最多,还带回答弃权判断。
原文
5月19日
14:02
14:02官方一手arXiv: DeepSeek@Jing Wang, Hongxuan Lu, Jazze Young, Shu Wang, Zhimin Xin
精选
DBES 是一个针对混合专家模型(MoE)中专家专业化程度的系统评估框架,包含多领域基准和五个理论驱动的指标:路由专业化、归一化有效秩、领域隔离度、路由刚度评分和N-gram专家度。研究发现不同模型呈现不同专业化范式:Qwen系列表现出模块化专业化和高领域隔离,而DeepSeek和GLM采用分布式协作。更重要的是,通过DBES识别高专业化专家路径进行领域特定后训练,仅用15%的训练资源即可实现66%到94.48%的专业领域性能提升。这项工作首次提供了独立于准确率指标的专家专业化评估方法,为下一代MoE系统的设计和后训练优化提供了关键见解。
论文MoE专家专业化基准测试

推荐理由:MoE模型的路由机制一直是个黑盒,DBES让开发者能真正量化专家是否在干专长的事。做MoE训练或微调的团队,可以用这套指标直接优化后训练效率,省资源又提效果,值得一试。
原文
5月15日
23:35
23:35berryxia@berryxia
精选73°
Daily Dose of Data Science 通过视觉图解清晰对比了 Transformer 和 Mixture of Experts(MoE)的核心差异。MoE 将 Transformer 中的单个前馈网络拆分为多个小专家网络,推理时仅激活部分专家,虽参数更多但计算更快。模型通过 Router(多分类器)为每个 token 选择 top-K 专家,但训练中面临“专家过选”和“负载不均”两大问题。前者通过加噪声和屏蔽非 top-K logit 解决,后者通过设置专家容量上限并自动转交 token 来平衡。Mixtral 8x7B 和 Llama 4 是典型 MoE 模型。
AI模型TransformerMoE路由机制

推荐理由:想搞懂 MoE 为什么又快又强,这篇视觉解释把路由和负载均衡的坑讲透了,做模型训练或推理优化的开发者值得一看。
原文
5月13日
19:12
19:12官方账号arXiv cs.LG@Sagi Ahrac, Noya Hochwald, Mor Geva
精选
稀疏混合专家模型(SMoE)在扩展语言模型时面临路由崩溃和负载均衡损失导致专业化下降的问题。本文揭示了路由器与其对应专家之间的几何耦合机制:对于给定token,所选专家的路由器权重和专家权重沿相同输入方向接收梯度,仅标量系数不同,因此匹配的路由器-专家方向累积相同的路由历史。实验表明,从零训练的1B SMoE中,更高的路由器分数预测更强的专家神经元激活,路由决策在所选专家内部被镜像。辅助负载均衡损失会破坏这种几何结构,使不同路由器方向相似度增加近三倍。最后,作者提出无参数在线K-Means路由器,通过维护专家隐藏状态运行平均值并基于余弦相似度分配token,在最低负载不平衡和适度困惑度增加下验证了几何耦合对有效路由的核心作用。
论文稀疏MoE路由机制几何耦合

推荐理由:做MoE模型训练或路由优化的研究者,这篇论文解释了路由崩溃和负载均衡损失的底层机制,看完会对如何设计更有效的路由策略有直接启发。
原文
精选全部日报登录