8月21日
10:07
10:07官方账号arXiv cs.LG@Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim
该研究提出一种计算高效的两步超参数迁移框架,用于为大型 MoE 模型估算最优学习率。首先,通过 MuP 适应和 Muon 优化器,证明了最优学习率在宽度缩放模型间可一致迁移。其次,通过建立预测性缩放定律,将小模型在有限预算下的最优值线性回归,成功外推至万亿 token 规模(R²=0.95)。该方法在 155B 总参数的 MoE 基础模型预训练中得到验证。
推荐理由:研究人员提出了一种方法,能通过小模型实验,准确预测万亿 token 规模 MoE 模型的最优学习率,省去了大量计算成本。他们用 155B 参数的模型验证了方法的有效性。
8月18日
8月17日
10:15
10:15官方账号arXiv cs.LG@Zewen Jin, Shen Fu, Zeping Duan, Shannon Wang, Weihao Wu, Chengjie Tang, Congkun Ai, Ping Gong, Zijian Dai, Youhui Bai, Cheng Li
DeaMoE是一种解码高效混合专家架构,将专家按专业领域分组为部门,同部门专家共享大部分参数,并各自保留少量私有参数。它采用定制两阶段路由策略,避免冗余加载,大幅提升大模型解码效率。相比vanilla MoE,DeaMoE每步加载权重最多减少50.9%,7B模型在A40上端到端TPOT加速1.33倍。在微基准测试中,DeepSeek-V3在A40和H100上分别达到2.00倍和1.97倍的峰值加速。
事件专题

推荐理由:DeaMoE让MoE小批量解码少搬权重、跑得更快,7B模型在A40上TPOT提速33%,DeepSeek-V3加速近2倍。
8月15日
02:01
02:01官方账号阿里通义 Qwen@Alibaba_Qwen
Qwen3.8-2.4T-A95B已在DeepInfra平台上线。该稀疏MoE模型总参数达2.4万亿,激活参数为950亿,共512个专家。它面向编程、智能体工作流和复杂推理设计,原生支持262K上下文。API定价为每百万输入2美元、每百万输出6美元、缓存输入0.2美元。
推荐理由:DeepInfra上线了Qwen最新稀疏MoE模型,2.4T总参数只激活95B,专攻编程和智能体场景,价格也公布了,想试API的可以直接上手。
00:28
00:28官方账号阿里通义 Qwen@Alibaba_Qwen
78°
阿里Qwen团队发布Qwen3.8-Max,总参数2.4T、激活参数95B、上下文窗口1M。该模型为开源权重MoE,编码与智能体能力突出。Together AI作为Day 0发布伙伴,已同步上线推理服务。开发者现可直接在Together AI平台调用该模型。

推荐理由:Qwen3.8-Max刚发布就上了Together AI,2.4T参数的开源MoE,当天就能用,编码和智能体能力都挺强。
8月13日
18:10
18:10Fireworks AI@FireworksAI_HQ
精选
Qwen3.8-2.4T-A95B 已在 Fireworks 平台上线,提供 Day-0 支持。该模型采用 2.4T 参数 MoE 架构,专为自主智能体、重度编码和大上下文窗口设计。Fireworks 表示它适合编码和智能体任务,开发者现在即可开始使用。

推荐理由:Fireworks 上线了 Qwen3.8-2.4T-A95B,2.4T 参数 MoE,主打智能体和写代码,有 Day-0 支持,直接就能用。
07:20
07:20官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA 发布全新 MoE 模型 Nemotron 3.5 Lightning。distil labs 作为欧洲发布合作伙伴,对其进行了微调。该团队将微调版与 4 个可比 MoE 模型在 6 项任务上对比,未微调时排名第三,微调后跃居第一。完整数值与失败场景已公布在 distil labs 博客上。
事件专题

推荐理由:NVIDIA 的 Nemotron 3.5 Lightning 微调后,在 6 项任务上超过 4 个同类 MoE 模型拿了第一。想知道怎么调出来的,可以看这篇。
8月12日
8月11日
22:43
22:43OpenRouter@OpenRouterAI
精选
NVIDIA Nemotron 3.5 Lightning已在OpenRouter上线。该模型为30B混合专家架构,仅激活3B参数,由Nemotron 3 Ultra蒸馏而来。它面向高容量、专业化的AI智能体工作负载,相比同类模型吞吐量最高提升4倍,任务完成速度最高快30%。
事件专题

推荐理由:NVIDIA新出的轻量MoE,30B参数只激活3B,跑智能体任务比同类快30%,想省算力可以试试。
22:03
22:03官方账号NVIDIA AI@NVIDIAAI
精选73°
NVIDIA推出Nemotron 3.5 Lightning,一个30B参数的MoE模型,仅激活3B参数。该模型专为常驻智能体设计,可快速完成高并发、专业化任务。其输出速度比同类模型快4倍。模型已开源,适合需要高效推理的场景。
事件专题

推荐理由:NVIDIA出了个30B MoE模型,只激活3B参数,跑得快4倍,适合做常驻智能体,开源可白嫖。
10:43
10:43官方一手arXiv: DeepSeek@Issac Zhu, Hscos Zhang, Keith Jiang, Jack Li, Hugh Yin, Jason Zhao
精选
FlashBoot是SGLang上的权重加载子系统,针对MoE模型弹性部署中的延迟问题。它通过FabricArena连续内存布局和FlashLoad零拷贝批量传输,将单节点权重加载从20.1秒降至0.4秒,加速50倍。FlashClone利用远程映射替代NCCL初始化,将跨节点复制时间从10-110秒降至约10毫秒。在NVL72上测试DeepSeek-V4-Pro和DeepSeek-V4-Flash,并发机架级加载从87秒降至0.32秒,加速超270倍。
事件专题

推荐理由:SGLang团队搞的FlashBoot,把大模型权重加载从20秒压到0.4秒,跨节点复制只要10毫秒。跑DeepSeek-V4系列,NVL72上实测数据,做弹性部署的值得看。
8月6日
10:11
10:11官方账号arXiv cs.LG@Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis
该论文通过合成和真实数据上的受控实验,揭示了多模态预训练中语言、视觉理解与视觉生成之间的非对称知识流。研究发现数据复杂度决定模态协同,共享注意力与归一化能促进协同,而早期联合训练优于晚期对齐。实验还发现“视觉懒惰”现象,即延迟融合会导致模型依赖语言先验。作者提出的高效配方仅用5%计算预算即可达到强生成性能,并训练了13.5B MoE模型在2T tokens上验证结论。
推荐理由:这篇论文把多模态预训练的内部机制拆开了,告诉你模态之间怎么互相影响、什么时候协同、什么时候拖后腿,还有省算力的训练配方,值得看看。
8月5日
16:51
02:48
02:48官方一手marktechpost@Asif Razzaq
Cursor Research开源了MoK,这是支撑Composer模型的MoE训练内核。MoK将专家混合的全部通信与计算融合进单个确定性内核。在GB300 NVL72机架上,MoK比最强公开基线快2.37倍。它需要Blackwell SM100或SM103 GPU,没有NVL72算力的用户无法使用。
事件专题

推荐理由:Cursor把训练内核MoK开源了,在GB300 NVL72上比最强公开基线快2.37倍,但得先有NVL72机器才能跑。
01:31
01:31官方账号Cursor@cursor_ai
72°
Cursor AI 开源了 Mixture-of-Kittens (MoK) 训练内核。该内核面向 NVIDIA NVL72 平台,将全部 MoE 通信与计算融合为单个确定性内核。相比最强公开基线,MoK 的训练速度最高可提升 2.37 倍。开发者现在可以获得完整代码并用于自己的训练任务。
事件专题

推荐理由:Cursor 把 NVL72 上的 MoE 训练内核开出来了,比公开方案快 2.37 倍,想省训练成本直接用。
8月2日
03:08
03:08官方一手marktechpost@Asif Razzaq
AMD推出Instella-MoE-16B-A3B,这是一个完全开源的混合专家语言模型,总参数16B,每个token仅激活2.8B。模型采用Gated MLA与FarSkip-Collective架构,在Instinct MI300X和MI325X GPU上从零训练。AMD已发布所有训练阶段的权重,并公开数据混合、配置和推理代码。
推荐理由:想用AMD显卡跑大模型的可以看看,AMD把16B总参数、2.8B激活的MoE模型全开源了,连训练配置和数据配方都给了。
7月31日
7月30日
13:32
13:32官方一手marktechpost@Michal Sutter
Moonshot AI 在 Kimi K3 Open Day 上开源了 MoonEP,这是一个专家并行(EP)通信库,专为分布式 Mixture-of-Experts(MoE)训练优化。该库采用 MIT 许可证发布,旨在解决大规模 EP 通信的效率瓶颈。MoonEP 提供平衡的负载分配和低延迟通信,可与 Kimi K3 等模型配合使用。
事件专题

推荐理由:Moonshot AI 开源了 MoonEP,一个专门加速 MoE 训练中专家并行通信的库,比现有方案更均衡高效,做分布式训练的同学可以试试。