一篇 MoE 训练论文:把固定 top-k 换成在 k 附近随机采样,Qwen3-30B-A3B 微调能多拿 2 分,推理成本不变。
#MoE
Mistral 放出了 1.05 万亿参数的 Le Chonk,激活才 490 亿,还能吃图和百万 token 上下文,权重月底开源。
美国 Reflection 放出了首个开源模型 Beam,500 多亿参数只激活 23B,想用更低算力打 DeepSeek 和 Qwen,写代码推理的可以看看。
训练万亿参数 MoE 模型的负载不均问题有了新解法,DeepSeek-V4-Pro 上实测训练加速最高 1.94 倍,还不用加硬件,做训练的可以看看。
这篇论文把混合专家思路搬进了 DeepONet 和 FNO,专门对付尖界面、异质系数这类难解的 PDE,误差比基线低不少,做科学计算的可以看看。
拿了 20 亿美金的 Reflection 放出首个开源模型 Beam,501B 参数只激活 23B,直接对标 GLM 和 DeepSeek 的 Flash 系列,权重本月放出。
Reflection AI 放出了首个开源模型 Beam,501B 只激活 23B,官方说打平 GLM-5.2 还省 3-4 倍算力,做编程和智能体的可以关注权重发布。
Reflection AI 开源了 Beam,501B 参数 MoE,作者称推理算力只要 GLM-5.2 的三分之一,Apache 2.0 可商用,不过注意这数字只是估算。
德国公司 Aleph Alpha 把 Kolibri 权重完全开源了,Apache 2.0 许可随便用,78B 参数 MoE 架构还特意喂了 21% 德语数据。
12GB 显存就能跑千亿参数模型,Strata 靠 MoE 冷热分离把专家塞进内存,5070 上实测 94 token/s,家用显卡玩家可以折腾了
德国的 Aleph Alpha 开源了 Kolibri-1,78B 参数但只激活 3B,还支持 260K 上下文,做德语项目的可以看看。
德国 Aleph Alpha 出了个开源模型 Kolibri,78B 参数激活才 3.46B,上下文 100 万 token,德语数据占两成,欧洲本地化部署可以看看。
Ling Flash 3.1 在乐高 Minecraft 任务中击败了 Deepseek,展示了其强大的智能体能力。
MoE 推理部署的人可以看看,DeepSeek-V4 和 GLM-5.3 上实测 TTFT 快了近一半,思路是让专家计算别干等慢副本。
IQuest 新出的 320B 编程模型 IQuest-Q1,vLLM 首日就能跑,上下文到 52 万 token,想本地部署智能体编程的可以看看。
跑 MoE 显存不够的人可以看看:微调路由加专家,Mixtral-8x7B 每层只缓存 4 个专家,取回次数降了 23.7%,速度更快精度还涨。
一篇教你怎么把 MoE 和循环 Transformer 结合的论文,Foil 把专家层数减半、循环翻倍,同等算力下预训练损失更低,代码也开源了。
华为把 openPangu-2.0 从预训练到 RL 的训练代码全开源了,配昇腾 MoE 栈,之前 Pro 505B 和 Flash 92B 权重也能配上完整流程。
StepFun 这个 Step 5 Preview 有 1M 上下文,主打长程智能体任务,权重月底开源,可以等开源后自己跑一跑。
NaiveAI 放出了 MIT 协议的 309B MoE 开源模型,激活参数只有 15.5B,还能吃下 1M 上下文,做长代码分析可以试试自己部署。
美团把 LongCat 升到 2.5 预览版,1M token 上下文加多模态,专门给跑长任务的编程智能体用,不过这次没放跑分数据。
美团放了个 1.6 万亿参数的 MoE 模型,能看图、写代码,还直接兼容 Claude Code,长文档党可以试试。
美团中秋半夜甩出 LongCat 2.5 预览版,16T 参数只激活 48,还有 1M 上下文和原生多模态,参数配置看着很猛,可以蹲一下实测成绩。
AWS 官方给出了在 EKS 上跑 MoE 强化学习的架构,用 EFA 加 DeepEP 把 RLHF/GRPO 训练吞吐量提高了 40%,自建训练集群的可以抄作业。