10:07官方账号arXiv cs.LG@Nayeon Kim, Hojin Lee, Yunju Bak, Jaesun Park, Boseop Kim该研究提出一种计算高效的两步超参数迁移框架,用于为大型 MoE 模型估算最优学习率。首先,通过 MuP 适应和 Muon 优化器,证明了最优学习率在宽度缩放模型间可一致迁移。其次,通过建立预测性缩放定律,将小模型在有限预算下的最优值线性回归,成功外推至万亿 token 规模(R²=0.95)。该方法在 155B 总参数的 MoE 基础模型预训练中得到验证。论文Mixture-of-ExpertsMoE超参数推荐理由:研究人员提出了一种方法,能通过小模型实验,准确预测万亿 token 规模 MoE 模型的最优学习率,省去了大量计算成本。他们用 155B 参数的模型验证了方法的有效性。原文稍后读已读值得跟进有用关注 Mixture-of-Experts
15:28官方账号arXiv cs.AI@Cedric Caruzzo, Donggeun Yoo, Tae Soo Kim该论文研究同权重MoE自蒸馏中,教师和学生模型共享权重但路由不同专家的问题。通过精确的块级分解,将路由项与内容项分离,在7个开源检查点和2个领域上测试。结果显示路由项对块输出的影响仅1.6倍,残差流暴露为3.2倍。PubMedQA预注册实验表明,路由项移动输出的效果不到自然上下文效应的一半,且可被匹配范数噪声复现。结论是路由移动本身不能证明行为影响,需先测量暴露度。论文MoE自蒸馏路由推荐理由:这篇论文把MoE路由分歧讲透了,用分解和实验证明路由项影响很小,做自蒸馏的值得看看。原文稍后读已读值得跟进有用关注 MoE
10:24官方一手arXiv: DeepSeek@Lie Li, Wen Li, Junxiao Shen, Gusheng Hu精选MAPLE是一个即插即用的MoE专家分配框架,可在不修改权重不重训练的前提下,按层重新分配路由专家预算。其核心是封闭式灵敏度引导分配,并用灵敏度约束的遗传搜索进一步优化。在DeepSeek-MoE-16B上,MAPLE仅用75%专家即在ARC-E上从65.09提升至71.40,ARC-C从48.49提升至51.50,BoolQ从80.03提升至82.38。通过SGLang部署,单GPU端到端延迟降低32.2%,吞吐量提升47.4%。AI模型MAPLEDeepSeek-MoE-16BSGLang推荐理由:MAPLE这个插件能让MoE大模型少开专家还更准,DeepSeek-MoE-16B用75%专家就能超原版,还快32%,不用改权重就能用。原文稍后读已读值得跟进有用关注 MAPLE
10:15官方账号arXiv cs.LG@Zewen Jin, Shen Fu, Zeping Duan, Shannon Wang, Weihao Wu, Chengjie Tang, Congkun Ai, Ping Gong, Zijian Dai, Youhui Bai, Cheng LiDeaMoE是一种解码高效混合专家架构,将专家按专业领域分组为部门,同部门专家共享大部分参数,并各自保留少量私有参数。它采用定制两阶段路由策略,避免冗余加载,大幅提升大模型解码效率。相比vanilla MoE,DeaMoE每步加载权重最多减少50.9%,7B模型在A40上端到端TPOT加速1.33倍。在微基准测试中,DeepSeek-V3在A40和H100上分别达到2.00倍和1.97倍的峰值加速。AI模型DeaMoEMoEDeepSeek-V31 个信源在谈事件专题推荐理由:DeaMoE让MoE小批量解码少搬权重、跑得更快,7B模型在A40上TPOT提速33%,DeepSeek-V3加速近2倍。原文稍后读已读值得跟进有用关注 DeaMoE
02:01官方账号阿里通义 Qwen@Alibaba_QwenQwen3.8-2.4T-A95B已在DeepInfra平台上线。该稀疏MoE模型总参数达2.4万亿,激活参数为950亿,共512个专家。它面向编程、智能体工作流和复杂推理设计,原生支持262K上下文。API定价为每百万输入2美元、每百万输出6美元、缓存输入0.2美元。AI模型QwenDeepInfraMoE推荐理由:DeepInfra上线了Qwen最新稀疏MoE模型,2.4T总参数只激活95B,专攻编程和智能体场景,价格也公布了,想试API的可以直接上手。原文稍后读已读值得跟进有用关注 Qwen
00:28官方账号阿里通义 Qwen@Alibaba_Qwen78°阿里Qwen团队发布Qwen3.8-Max,总参数2.4T、激活参数95B、上下文窗口1M。该模型为开源权重MoE,编码与智能体能力突出。Together AI作为Day 0发布伙伴,已同步上线推理服务。开发者现可直接在Together AI平台调用该模型。AI模型Qwen3.8-MaxTogether AI开源模型推荐理由:Qwen3.8-Max刚发布就上了Together AI,2.4T参数的开源MoE,当天就能用,编码和智能体能力都挺强。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
00:27官方账号阿里通义 Qwen@Alibaba_Qwen阿里通义千问的Qwen3.8-Max(即Qwen3.8-2.4T-A95B)在Fireworks平台首发上线,获得Day 0支持。这款模型采用MoE架构,总参数达2.4T,激活参数95B,专为自主智能体、重度编码和超长上下文场景设计。开发者现可通过Fireworks直接调用,用于构建agent工作流和代码生成任务。AI模型Qwen3.8-MaxFireworks智能体推荐理由:阿里把2.4T参数的MoE模型Qwen3.8-Max放到了Fireworks上,今天就能用,专门干智能体和写代码的活儿。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
12:29官方一手arXiv: DeepSeek@Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song论文在专家并行MoE服务中发现,GPU吞吐量并不由token数或激活专家数单独决定:约156-168 token以下是显存权重流主导,以上则按128-tile对M维度取整。据此提出TEMPO调度器,将每批调度建模为固定费用makespan问题,在毫秒级求解;在8卡Testbed A上,相对最优固定基线最多提升15.5%,其余场景差距在1%以内。端到端测试中,Qwen3-235B吞吐提升4-6%、p99延迟降低约15.6%,DeepSeek-V3则未见收益。TEMPO论文强调这是阶段图预测的结果,并非普适胜利。论文TEMPOMoE专家并行推荐理由:如果你在做MoE推理,TEMPO这个调度器在内存/算力瓶颈混合时能比常规方案快15.5%;不过DeepSeek-V3那种通信瓶颈场景它不灵。原文稍后读已读值得跟进有用关注 TEMPO
20:52shao__meng@shao__meng微信团队在 X 上发布 WeLM 大语言模型系列,包含 80B (A3B) 和 617B (A23B) 两个型号。其中 A3B 指激活 3B 参数,A23B 指激活 23B 参数,对应总参数规模为 80B 与 617B。WeLM 由 Weixin 团队打造,官方帖文强调其核心优势是资源效率,并以 X 作为首发渠道。AI模型WeLM微信MoE推荐理由:微信出了 WeLM,80B 和 617B 两个版本,主打省资源,激活参数只有 3B 和 23B。想省算力可以看看。原文稍后读已读值得跟进有用关注 WeLM
18:15官方账号NVIDIA AI@NVIDIAAI精选英伟达发布Nemotron 3.5 Lightning,一款30B参数的MoE模型,活跃参数仅3B。该模型由Nemotron 3 Ultra蒸馏而来,现已上线Fireworks平台。它在PinchBench上表现强劲,并在AA-Omniscience非幻觉测试中获得顶尖分数。模型专为高吞吐智能体工作流设计,强调可靠性与专精化。AI模型NemotronFireworksNVIDIA10 个信源在谈事件专题推荐理由:想做智能体又怕模型太贵太慢?Nemotron 3.5 Lightning只有3B活跃参数,在Fireworks上直接就能调。原文稍后读已读值得跟进有用关注 Nemotron
18:10Fireworks AI@FireworksAI_HQ精选Qwen3.8-2.4T-A95B 已在 Fireworks 平台上线,提供 Day-0 支持。该模型采用 2.4T 参数 MoE 架构,专为自主智能体、重度编码和大上下文窗口设计。Fireworks 表示它适合编码和智能体任务,开发者现在即可开始使用。AI模型Qwen3.8-2.4T-A95BFireworks智能体推荐理由:Fireworks 上线了 Qwen3.8-2.4T-A95B,2.4T 参数 MoE,主打智能体和写代码,有 Day-0 支持,直接就能用。原文稍后读已读值得跟进有用关注 Qwen3.8-2.4T-A95B
17:48IT之家(博客/媒体)微信团队发布大语言模型 WeLM,核心方向是资源利用效率。WeLM-80B 拥有 800 亿总参数和 30 亿激活参数,已部署在微信原生 AI 助手小微上,支持聊天、搜索和调用小程序服务。WeLM-617B 总参数达 6170 亿、激活参数 230 亿,采用混合专家(MoE)架构,目前正在开发中,面向智能小程序开发和小微工具生成等复杂任务。AI模型WeLM微信腾讯推荐理由:微信自己搞的 WeLM 80B 已经在小微里落地了,617B MoE 版也在路上,做微信生态开发的可以盯一下。原文稍后读已读值得跟进有用关注 WeLM
07:20官方账号NVIDIA AI@NVIDIAAI精选NVIDIA 发布全新 MoE 模型 Nemotron 3.5 Lightning。distil labs 作为欧洲发布合作伙伴,对其进行了微调。该团队将微调版与 4 个可比 MoE 模型在 6 项任务上对比,未微调时排名第三,微调后跃居第一。完整数值与失败场景已公布在 distil labs 博客上。AI模型Nemotron 3.5 LightningNVIDIAdistil labs10 个信源在谈事件专题推荐理由:NVIDIA 的 Nemotron 3.5 Lightning 微调后,在 6 项任务上超过 4 个同类 MoE 模型拿了第一。想知道怎么调出来的,可以看这篇。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
17:42Aravind Srinivas@AravSrinivas精选NVIDIA 的 Nemotron 3.5 Lightning 现已面向所有开发者开放,可通过 Perplexity Agent API 调用。该模型为开源 30B MoE 架构,仅激活 3B 参数,专为高频智能体执行层设计,适用于工具调用、验证和子智能体任务。输入定价为每百万 tokens 0.0115 美元,输出定价为每百万 tokens 0.17 美元。开发者可将 Lightning 与 Nemotron Ultra 等前沿模型搭配,用于规划与批量执行。AI产品Nemotron 3.5 LightningPerplexityNVIDIA10 个信源在谈事件专题推荐理由:NVIDIA 把 30B MoE 的 Lightning 放到 Perplexity API 上了,每百万输入才 1 分多钱,适合跑高频工具调用,跟 Ultra 搭配干活很划算。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
16:02官方一手marktechpost@Asif Razzaq精选NVIDIA推出开源MoE模型Nemotron 3.5 Lightning,总参数量30B,激活参数仅3B,专为智能体执行层设计。同时发布NeMo Switchyard模型路由器,可将每个执行步骤路由到成本最低且能力足够的模型。该组合旨在降低智能体推理成本,提升执行效率。Nemotron 3.5 Lightning基于开源许可发布,开发者可自由使用。AI模型NemotronNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA开源了30B MoE,激活才3B,跑起来便宜,还配了个路由器帮你省钱,搞智能体的可以看看。原文稍后读已读值得跟进有用关注 Nemotron
09:52IT之家(博客/媒体)英伟达于8月11日发布Nemotron 3.5 Lightning,这是一款拥有300亿参数的MoE开源模型,专为大型多智能体系统设计。相比同类模型,其输出速度最高提升4倍,智能体任务整体完成速度加快30%。该模型支持本地运行于NVIDIA RTX PC、DGX Spark等设备,也可扩展至企业级数据中心和云端环境。开源链接已提供在Hugging Face、ModelScope和OpenRouter等平台。AI模型Nemotron 3.5 Lightning英伟达开源模型10 个信源在谈事件专题推荐理由:英伟达新出的30B开源模型,跑智能体任务比同类快4倍,还能本地跑,搞多智能体开发的可以试试。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
03:46Aravind Srinivas@AravSrinivasNVIDIA推出Nemotron 3.5 Lightning,这是一款开放权重的30B MoE模型,仅3B参数激活,专为常驻智能体设计,可高效处理高吞吐、专业化任务。其输出速度比同类模型快4倍,能在笔记本或DGX Spark等本地硬件上流畅运行。用户也可通过Perplexity使用更大的Nemotron Ultra版本。AI模型Nemotron 3.5 LightningNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA新出的开源MoE模型,30B参数但只激活3B,笔记本就能跑,速度还快4倍,做智能体任务很合适。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
00:46ollama@ollama精选NVIDIA 的 Nemotron 3.5 Lightning 现已可通过 Ollama 本地运行。这是一款 30B 参数的混合专家模型,仅激活 3B 参数,支持 1M token 上下文。该模型专为常驻运行的智能体设计,擅长编码、工具调用和多轮对话。相比同类规模的开源模型,其吞吐量提升 4 倍,任务完成时间降低 30%。用户可通过 Claude Code、Hermes Agent 或 OpenClaw 等工具直接调用。AI模型Nemotron 3.5 LightningNVIDIAOllama10 个信源在谈事件专题推荐理由:NVIDIA 新出的 30B 模型,跑在本地,专门给常驻智能体用,速度快 4 倍,还支持 1M 上下文,搞智能体的可以试试。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
23:29Fireworks AI@FireworksAI_HQ精选NVIDIA 推出 Nemotron 3.5 Lightning,这是一款 30B MoE 模型,仅 3B 参数激活,专为高吞吐智能体任务设计。该模型从 Nemotron 3 Ultra 蒸馏而来,在 PinchBench 和 AA-Omniscience Non-Hallucination 基准上表现强劲。目前已在 Fireworks 平台上线,供开发者用于构建智能体工作流。AI模型Nemotron 3.5 LightningNVIDIAFireworks10 个信源在谈事件专题推荐理由:NVIDIA 新出的 30B MoE 模型,3B 激活参数跑得快,专为智能体场景优化,Fireworks 上直接能用。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
22:43OpenRouter@OpenRouterAI精选NVIDIA Nemotron 3.5 Lightning已在OpenRouter上线。该模型为30B混合专家架构,仅激活3B参数,由Nemotron 3 Ultra蒸馏而来。它面向高容量、专业化的AI智能体工作负载,相比同类模型吞吐量最高提升4倍,任务完成速度最高快30%。AI模型NemotronNVIDIAOpenRouter10 个信源在谈事件专题推荐理由:NVIDIA新出的轻量MoE,30B参数只激活3B,跑智能体任务比同类快30%,想省算力可以试试。原文稍后读已读值得跟进有用关注 Nemotron
22:03官方账号NVIDIA AI@NVIDIAAI精选73°NVIDIA推出Nemotron 3.5 Lightning,一个30B参数的MoE模型,仅激活3B参数。该模型专为常驻智能体设计,可快速完成高并发、专业化任务。其输出速度比同类模型快4倍。模型已开源,适合需要高效推理的场景。AI模型NemotronNVIDIAMoE10 个信源在谈事件专题推荐理由:NVIDIA出了个30B MoE模型,只激活3B参数,跑得快4倍,适合做常驻智能体,开源可白嫖。原文稍后读已读值得跟进有用关注 Nemotron
18:01IT之家(博客/媒体)精选蚂蚁百灵在 Hugging Face 开源 Ling-3.0-tiny 模型,总参数 7.9B,每 Token 激活 1.3B 参数,采用混合推理 MoE 架构。该模型将 KDA 和 MLA 按 3:1 比例交替堆叠,包含 128 个路由专家,兼顾上下文处理与计算成本。官方提供 BF16、FP8 和 INT4 权重版本,适配不同平台。在 M4 Pro MacBook 上推理速度约 86-90 Token/s,8K 上下文峰值内存约 8.34 GiB。AI模型Ling-3.0-tiny蚂蚁百灵MoE推荐理由:蚂蚁百灵开源了个轻量推理模型,7.9B 参数但每 Token 只激活 1.3B,Mac mini 上跑得飞快,适合本地部署。原文稍后读已读值得跟进有用关注 Ling-3.0-tiny
11:07官方账号arXiv cs.LG@Nagur Shareef Shaik, Jeongwoo Park, Yeong-Jin Kim, Jaeuk Jung, Hyunjung Oh, Dong Hye Ye视网膜眼底图像常同时存在多种病理,但标准深度学习分类器对所有图像施加静态相同计算。研究者提出新架构,结合引导上下文门控空间注意力和稀疏路由专家混合模块,实现可解释的数据驱动分解。专家分配显著依赖疾病,健康状态和形态学上不同的病理隔离到专属专家。在五类患者分离的5折交叉验证中,模型达到0.912±0.008宏AUC和0.653±0.014宏F1。Grad-CAM++和t-SNE可视化证实专家路由与局部病灶对齐,并将共病案例映射到其组成簇之间。论文视网膜MoE稀疏路由推荐理由:这篇论文用稀疏MoE做视网膜多病分类,专家分配能对应具体病灶,宏AUC到0.912,搞医学影像的可以看看。原文稍后读已读值得跟进有用关注 视网膜
10:49官方一手arXiv: DeepSeek@Matteo Grella精选PTQTP将LLM权重矩阵分解为两个三元平面,本研究首次将尺度比固定为3的约束引入其求解器,使分解坍缩为统一九级量化器。两个三元平面无损折叠为4位码平面,作为持久服务表示,磁盘字节、专家缓存和内核输入均为4.0625位/权重块。该方法应用于DeepSeek-V4-Flash-0731的284B-A13B MoE模型,在64GB笔记本上从MXFP4权重一次性量化并流式加载专家。与4.5位Q4_K基线相比,在5/5测试中匹配官方API(Q4_K为4/5),MMLU子集得分86对84,解码速度快6.7%,文件小9%。尽管权重重建误差和困惑度更高,但参考保真度无显著差异。论文PTQTPDeepSeek-V4MoE推荐理由:这篇论文把PTQTP量化器约束成九级格式,在DeepSeek-V4上做到和官方API几乎一样准,还快6.7%、文件小9%,适合搞MoE推理优化的朋友看。原文稍后读已读值得跟进有用关注 PTQTP
10:47官方一手arXiv: DeepSeek@Zongfei Li精选一项新研究质疑稀疏MoE路由器中专家选择与输出加权是否应使用相同分数。在预训练的OLMoE-1B-7B上,仅改变集合内聚合方式,结构化oracle将全周期交叉熵提升0.0160±0.0039。研究者训练了301K参数的FDAA后处理头,在冻结主干、路由器和专家的情况下,将WikiText-103测试集Delta CE提升至-0.1523±0.0031。在DeepSeek-V2-Lite上复现固定调度审计,路由器Top1识别最佳选中专家的比例仅为12.5%和16.7%。结果表明专家选择与专家承诺应跨架构区分。论文MoEOLMoEDeepSeek-V2-Lite推荐理由:这篇论文用OLMoE和DeepSeek-V2-Lite实测证明,MoE路由的选专家和加权输出不该共用一套分数,FDAA方法能白捡性能提升,做MoE优化的值得看。原文稍后读已读值得跟进有用关注 MoE
10:43官方一手arXiv: DeepSeek@Issac Zhu, Hscos Zhang, Keith Jiang, Jack Li, Hugh Yin, Jason Zhao精选FlashBoot是SGLang上的权重加载子系统,针对MoE模型弹性部署中的延迟问题。它通过FabricArena连续内存布局和FlashLoad零拷贝批量传输,将单节点权重加载从20.1秒降至0.4秒,加速50倍。FlashClone利用远程映射替代NCCL初始化,将跨节点复制时间从10-110秒降至约10毫秒。在NVL72上测试DeepSeek-V4-Pro和DeepSeek-V4-Flash,并发机架级加载从87秒降至0.32秒,加速超270倍。论文FlashBootSGLangDeepSeek-V48 个信源在谈事件专题推荐理由:SGLang团队搞的FlashBoot,把大模型权重加载从20秒压到0.4秒,跨节点复制只要10毫秒。跑DeepSeek-V4系列,NVL72上实测数据,做弹性部署的值得看。原文稍后读已读值得跟进有用关注 FlashBoot
07:55IT之家(博客/媒体)蚂蚁集团百灵大模型宣布正式开源 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等版本。该模型支持 API 调用、单机私有化和高性能部署三种落地方式,在指定 GPU 测试配置下平均输出速率突破 1100 tokens/s。在 Artificial Analysis 榜单中,Ling-3.0-flash 输出速度为 353 tokens/s,AA Intelligence Index 中每项任务加权平均调用成本约 0.04 美元。8 月 7 日至 8 月 31 日,Ling Studio 上可享 2.5 折优惠。AI模型Ling-3.0-flash蚂蚁集团百灵推荐理由:蚂蚁百灵开源了 Ling-3.0-flash,124B 总参只激活 5.1B,能单机跑,输出超 1100 tokens/s。原文稍后读已读值得跟进有用关注 Ling-3.0-flash
10:11官方账号arXiv cs.LG@Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis该论文通过合成和真实数据上的受控实验,揭示了多模态预训练中语言、视觉理解与视觉生成之间的非对称知识流。研究发现数据复杂度决定模态协同,共享注意力与归一化能促进协同,而早期联合训练优于晚期对齐。实验还发现“视觉懒惰”现象,即延迟融合会导致模型依赖语言先验。作者提出的高效配方仅用5%计算预算即可达到强生成性能,并训练了13.5B MoE模型在2T tokens上验证结论。论文多模态预训练MoE推荐理由:这篇论文把多模态预训练的内部机制拆开了,告诉你模态之间怎么互相影响、什么时候协同、什么时候拖后腿,还有省算力的训练配方,值得看看。原文稍后读已读值得跟进有用关注 多模态
16:51量子位@鹭羽Sand.ai开源了全球首个千亿参数MoE视频生成模型,总参数达114B,激活参数仅6B。该模型支持生成10秒1080P视频,单次生成成本约为0.5元。这标志着开源视频生成模型进入千亿MoE时代。AI模型Sand.aiMoE视频生成推荐理由:Sand.ai开源了千亿MoE视频生成模型,114B参数只激活6B,跑10秒1080P只要5毛钱,视频生成也卷性价比了。原文稍后读已读值得跟进有用关注 Sand.ai
02:48官方一手marktechpost@Asif RazzaqCursor Research开源了MoK,这是支撑Composer模型的MoE训练内核。MoK将专家混合的全部通信与计算融合进单个确定性内核。在GB300 NVL72机架上,MoK比最强公开基线快2.37倍。它需要Blackwell SM100或SM103 GPU,没有NVL72算力的用户无法使用。AI模型MoKCursorMoE3 个信源在谈事件专题推荐理由:Cursor把训练内核MoK开源了,在GB300 NVL72上比最强公开基线快2.37倍,但得先有NVL72机器才能跑。原文稍后读已读值得跟进有用关注 MoK
01:31官方账号Cursor@cursor_ai72°Cursor AI 开源了 Mixture-of-Kittens (MoK) 训练内核。该内核面向 NVIDIA NVL72 平台,将全部 MoE 通信与计算融合为单个确定性内核。相比最强公开基线,MoK 的训练速度最高可提升 2.37 倍。开发者现在可以获得完整代码并用于自己的训练任务。AI产品CursorMoKNVL7210 个信源在谈事件专题推荐理由:Cursor 把 NVL72 上的 MoE 训练内核开出来了,比公开方案快 2.37 倍,想省训练成本直接用。原文稍后读已读值得跟进有用关注 Cursor
11:58官方账号arXiv cs.LG@Tom Saliencro, Rohan Desai, Priya Nair, Maya Lindqvist, Daniel WhitmoreVI-MoLE提出将混合LoRA专家路由视为认证信息价值分配问题。该方法在验证集上为每个专家前缀后的反事实风险输出同时有效的上界证书,并依据单位成本的边际风险降低量分配全局适配器预算。与仅依赖不确定性的动态路由不同,VI-MoLE能区分可恢复风险与残余歧义。论文在匹配计算量准确率、证书覆盖率、风险-覆盖率、分布偏移和尾延迟上与固定及动态MoE-LoRA路由对比。实验设置来自arXiv 2608.02528v1。论文LoRAVI-MoLEMoE推荐理由:这论文把“不确定就多算”的LoRA路由换成了信息价值定价,能证明预算花在哪风险降最多,还带回答弃权判断。原文稍后读已读值得跟进有用关注 LoRA
18:13官方账号阿里通义 Qwen@Alibaba_Qwen72°Qwen 3.8 Max已上线Command Code Go,并宣布将开放权重。该模型为2.4T参数的MoE旗舰,输入价格每百万tokens 2美元,输出6美元。缓存价格每百万tokens 0.25美元,整体比3.7版本便宜20%。下周将发布Qwen3.8-Max和Qwen3.8-27B的开放权重。AI模型QwenCommand Code Go开源模型推荐理由:Qwen 3.8 Max上线了,价格比3.7便宜20%,下周还要开源权重,值得蹲一下。原文稍后读已读值得跟进有用关注 Qwen
03:08官方一手marktechpost@Asif RazzaqAMD推出Instella-MoE-16B-A3B,这是一个完全开源的混合专家语言模型,总参数16B,每个token仅激活2.8B。模型采用Gated MLA与FarSkip-Collective架构,在Instinct MI300X和MI325X GPU上从零训练。AMD已发布所有训练阶段的权重,并公开数据混合、配置和推理代码。AI模型Instella-MoE-16B-A3BAMDInstinct推荐理由:想用AMD显卡跑大模型的可以看看,AMD把16B总参数、2.8B激活的MoE模型全开源了,连训练配置和数据配方都给了。原文稍后读已读值得跟进有用关注 Instella-MoE-16B-A3B
11:48IT之家(博客/媒体)LG AI研究院发布了K-EXAONE 2.0,采用混合注意力MoE架构,总参数750B,激活参数37B,规模是初代K-EXAONE的3倍以上,成为韩国迄今最大AI基础模型。该模型以Apache 2.0许可证开源,在24项基准测试中平均得分70.1,比初代63.3分提高超10%。在三大编码和智能体编码基准上性能提升约30%,长上下文理解优于GLM-5.1,智能体工具使用能力优于智谱GLM-5.1和Qwen3.5,指令执行表现与GLM-5.1、DeepSeek V4 Pro Max等相当。AI模型K-EXAONELG AI研究院开源模型推荐理由:LG开源了韩国最大的K-EXAONE 2.0,750B参数,跑分比初代高10%,长上下文和工具调用还压过了GLM-5.1。原文稍后读已读值得跟进有用关注 K-EXAONE
10:30IT之家(博客/媒体)77°华为今日开源 openPangu-2.0-Pro 模型权重、基础推理代码及技术报告。该模型为昇腾 NPU 训练的 MoE 架构,总参数约 505B,每 token 激活约 18B,支持 512k 上下文,训练数据约 34T tokens。模型采用 MLA 加 DSA/SWA 分层混合、3 头 MTP 自投机等架构升级,后训练结合 SFT、多专项 RL 与 OPD 蒸馏。此前 openPangu-2.0-Flash(92B 参数)已于 6 月 30 日开源,本次 Pro 是 openPangu 2.0 七组件开源计划的一部分。AI模型openPangu-2.0-Pro华为盘古1 个信源在谈事件专题推荐理由:华为盘古 505B 的 MoE 模型 openPangu-2.0-Pro 开源了,带权重和推理代码,支持 512k 上下文,想跑昇腾生态可以看。原文稍后读已读值得跟进有用关注 openPangu-2.0-Pro
09:53官方一手arXiv: DeepSeek@Huiyuan Tian, Bonan Xu, Shijian Li精选本研究提出专家子空间分离指数(ESSI)和匹配路由残差等方法,区分路由一致性、候选质量和上下文交互。在六种MoE架构中发现专家子空间高度重叠,但实际路由对token表征的解释优于匹配替代方案。在OLMoE、Mixtral和DeepSeek的39个阶乘单元中,选中专家在每个单元都比最强的未选中候选解释更多残差,但实际前缀在所有交互中均缩小该优势,所有95%置信区间低于零。尽管几何重叠,添加后续专家在39个冻结路由比较中改善24个单元的下一token预测,其余15个不显著,受控训练中三个种子均偏好Top-2优于Top-1。这一模式表明路由从共享几何邻域选择token相关专家,而多专家计算无需不相交线性覆盖即可保持效用。论文MoE稀疏混合专家OLMoE推荐理由:这篇论文把MoE路由的几何重叠和功能价值分开了,用了新指标ESSI和受控实验,结论很扎实,比单纯算相似度靠谱。原文稍后读已读值得跟进有用关注 MoE
13:32官方一手marktechpost@Michal SutterMoonshot AI 在 Kimi K3 Open Day 上开源了 MoonEP,这是一个专家并行(EP)通信库,专为分布式 Mixture-of-Experts(MoE)训练优化。该库采用 MIT 许可证发布,旨在解决大规模 EP 通信的效率瓶颈。MoonEP 提供平衡的负载分配和低延迟通信,可与 Kimi K3 等模型配合使用。AI模型Moonshot AIMoonEPKimi K310 个信源在谈事件专题推荐理由:Moonshot AI 开源了 MoonEP,一个专门加速 MoE 训练中专家并行通信的库,比现有方案更均衡高效,做分布式训练的同学可以试试。原文稍后读已读值得跟进有用关注 Moonshot AI
11:43官方账号arXiv cs.LG@Tom Saliencro, Rohan Desai, Priya Nair, Maya Lindqvist, Daniel WhitmoreMixture-of-Experts (MoE) LoRA 通常对每个 token 固定激活 k 个专家,但易在简单 token 上浪费计算、难 token 上欠拟合。CARE 利用路由器输出分布作为不确定性信号,以核采样方式按置信度阈值自适应选择专家,且当已选专家分歧时小幅扩展。在 LLaMA-3.1-8B 和 Qwen2.5-7B 的 8 个常识基准、数学、代码和知识任务上,CARE 在相同计算量下优于固定 top-k MoE-LoRA,并能在激活更少专家时匹敌固定 k=4 基线。置信度与分歧信号还提升了 OOD 检测效果,超越 MSP、熵和多遍代理方法。论文CAREMoELoRA推荐理由:MoE-LoRA 不用固定 k 值了,CARE 根据 token 难度自动选专家,在 LLaMA 和 Qwen 上效率更高,还能顺手做 OOD 检测。原文稍后读已读值得跟进有用关注 CARE
18:44IT之家(博客/媒体)71°阿里云宣布灵骏真武M890超节点实例成功适配月之暗面2.8万亿参数大模型Kimi K3。Kimi K3采用MoE架构,基于平头哥真武M890训推一体AI芯片,64张M890通过ICN Switch 1.0实现800GB/s All-to-All高速互联,显存规模达9TB。联合优化使万亿级MoE模型EP专家并行通信流量运行在单一高带宽域内,提升推理效率。T-Head SAIL软件栈让Mooncake推理框架即开即跑,Triton支持减少自定义算子重写工作量。AI产品Kimi K3阿里云灵骏真武M89010 个信源在谈事件专题推荐理由:阿里云真武M890超节点实例首发适配Kimi K3,2.8万亿参数MoE模型推理效率获硬件级优化,适合关注大模型部署和推理加速的开发者。原文稍后读已读值得跟进有用关注 Kimi K3