11:43Gary Marcus@GaryMarcus75°Gary Marcus在推文中称,2017年以来除规模扩展外,最大突破是将基础模型扩展为整合工具和代码解释器的系统,例如Claude Code。João Mendonça则反驳,LLM领域已有9年没有突破,自2017年6月《Attention Is All You Need》和2017年1月应用稀疏MoE之后,架构没有质变。这场辩论的双方都承认,Claude Code是工具化系统路线的代表产品。AI模型Claude Code智能体Transformer推荐理由:Gary说最大突破是模型加工具和代码解释器,像Claude Code;另有人说9年没真突破。原文稍后读已读值得跟进有用关注 Claude Code
09:48官方一手arXiv: DeepSeek@Tianyang Zhu精选DeepSeek-V4-Flash的稀疏MoE推理中,数学等价的专家归约顺序会产生可观察的执行分歧。研究对比4种聚合方案:720个A模式顺序产生10个延续盆地,720个B模式顺序形成360个结构类和11个盆地。在一条中文提示词下,B类分裂为202个裁员、113个招聘和45个其他延续。192条持久轨迹中,P32、A、B方案改变所有原生参考路由,而C方案保留路由、token序列和文本。FP64精确重建可在301个下游状态上获得七步一致。论文DeepSeek-V4-Flash稀疏MoE数值精度10 个信源在谈事件专题推荐理由:这篇论文把DeepSeek-V4-Flash的MoE数值细节挖得很深,归约顺序不同结果就不同,跑推理时得留神。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
15:13官方账号vLLM@vllm_projectPoolside发布Laguna S 2.1,一个118B参数的稀疏MoE开放权重模型,每token仅激活8B参数。模型支持高达1M的上下文长度,并同时提供思考与非思考两种模式,基准为OpenMDW-1.1。该模型专为智能编码和长期任务设计,具备规划、工具调用和自我纠错能力。官方NVFP4量化版本可在单台NVIDIA DGX Spark上本地运行。AI模型poolsideLaguna S 2.1稀疏MoE10 个信源在谈事件专题推荐理由:Poolside新出的Laguna S 2.1模型,稀疏MoE只激活8B就能达到1M上下文,还能本地跑在DGX Spark上,写代码和长期任务都很顺手。原文稍后读已读值得跟进有用关注 poolside
10:33官方账号arXiv cs.LG@Rohan Shravan精选72°该论文报告了在单个8GPU节点上端到端训练千亿参数稀疏混合专家模型的方法。LightningLM 0.1V 是一个基于循环骨干的语言模型家族,从小型稠密种子模型逐步扩展至120B参数、460个路由专家(top-12路由)。通过状态保持扩展策略,每个更大模型从小模型的训练权重生长而来,活跃参数从1.78B单调增长至5.93B。关键创新包括:可逆循环栈使激活内存不随模型增长而增加;状态保持扩展原则确保各阶段扩展不失败;单节点经济策略TQP通过量化基专家权重和训练低秩适配器,将优化器状态从100B+压缩至2.26B参数。模型家族、分词器和训练代码均已开源。论文稀疏MoE模型扩展可逆循环推荐理由:这篇论文解决了大模型训练资源门槛高的问题——单节点8卡就能训120B模型,做MoE和模型扩展的团队可以直接参考其状态保持原则和TQP策略,省下大量硬件成本。原文稍后读已读值得跟进有用关注 稀疏MoE
12:49Fireworks AI@FireworksAI_HQ精选72°Step 3.7 Flash 是阶跃星辰(StepFun)发布的 198B 稀疏 MoE 视觉语言模型,专为推理效率从头设计。该模型包含 196B 语言骨干和 1.8B 视觉编码器,支持原生多模态理解和行动,可靠工具使用,以及增强的网页和视觉搜索。在真实智能体工作负载下,推理速度可达 400 tok/sec,并采用 Apache 2.0 开源许可。Fireworks AI 已提供在线试用。AI模型视觉语言模型稀疏MoE推理效率1 个信源在谈事件专题推荐理由:多数实验室事后才考虑推理效率,而 Step 3.7 Flash 从设计之初就为推理优化,做智能体应用和视觉语言模型的开发者可以直接试用,感受 400 tok/sec 的流畅体验。原文稍后读已读值得跟进有用关注 视觉语言模型
19:12官方账号arXiv cs.LG@Sagi Ahrac, Noya Hochwald, Mor Geva精选稀疏混合专家模型(SMoE)在扩展语言模型时面临路由崩溃和负载均衡损失导致专业化下降的问题。本文揭示了路由器与其对应专家之间的几何耦合机制:对于给定token,所选专家的路由器权重和专家权重沿相同输入方向接收梯度,仅标量系数不同,因此匹配的路由器-专家方向累积相同的路由历史。实验表明,从零训练的1B SMoE中,更高的路由器分数预测更强的专家神经元激活,路由决策在所选专家内部被镜像。辅助负载均衡损失会破坏这种几何结构,使不同路由器方向相似度增加近三倍。最后,作者提出无参数在线K-Means路由器,通过维护专家隐藏状态运行平均值并基于余弦相似度分配token,在最低负载不平衡和适度困惑度增加下验证了几何耦合对有效路由的核心作用。论文稀疏MoE路由机制几何耦合推荐理由:做MoE模型训练或路由优化的研究者,这篇论文解释了路由崩溃和负载均衡损失的底层机制,看完会对如何设计更有效的路由策略有直接启发。原文稍后读已读值得跟进有用关注 稀疏MoE
19:11官方账号arXiv cs.LG@Chenyang Song, Weilin Zhao, Xu Han, Chaojun Xiao, Yingfa Chen, Zhiyuan LiuDECO是一种针对端侧设备设计的稀疏MoE架构,旨在相同参数预算和训练Token数下达到稠密Transformer的性能。它采用可微分灵活的ReLU路由和可学习专家缩放,结合新激活函数NormSiLU,提高了路由专家激活比率的稳定性和内在稀疏性。实验显示,仅激活20%专家即可匹配稠密模型性能,专用加速核在真实硬件上相比稠密推理加速3倍。这一工作对推动MoE在资源受限设备上的实际部署具有重要意义。论文稀疏MoE端侧部署推理加速推荐理由:DECO在保持性能和降低计算开销方面取得了良好平衡,其3倍加速和严格的稀疏性控制对端侧AI部署具有实际参考价值。原文稍后读已读值得跟进有用关注 稀疏MoE