10:15官方账号arXiv cs.LG@Zewen Jin, Shen Fu, Zeping Duan, Shannon Wang, Weihao Wu, Chengjie Tang, Congkun Ai, Ping Gong, Zijian Dai, Youhui Bai, Cheng LiDeaMoE是一种解码高效混合专家架构,将专家按专业领域分组为部门,同部门专家共享大部分参数,并各自保留少量私有参数。它采用定制两阶段路由策略,避免冗余加载,大幅提升大模型解码效率。相比vanilla MoE,DeaMoE每步加载权重最多减少50.9%,7B模型在A40上端到端TPOT加速1.33倍。在微基准测试中,DeepSeek-V3在A40和H100上分别达到2.00倍和1.97倍的峰值加速。AI模型DeaMoEMoEDeepSeek-V31 个信源在谈事件专题推荐理由:DeaMoE让MoE小批量解码少搬权重、跑得更快,7B模型在A40上TPOT提速33%,DeepSeek-V3加速近2倍。原文稍后读已读值得跟进有用关注 DeaMoE
10:11orange.ai@oran_ge评论者 oran_ge 在 X 上评价 DSH 是技术自嗨的巅峰之作。他认为 Transformer 在某种意义上也属于同类。这条推文目前获得 1 个喜欢和 1152 次浏览。AI模型DSHTransformer模型架构推荐理由:有人发推吐槽 DSH 和 Transformer 都是技术自嗨,虽然只有 1152 次浏览,但观点值得围观。原文稍后读已读值得跟进有用关注 DSH
09:18官方一手arXiv: DeepSeek@Jia Peng Lim, Hai Leong ChieuDeepSeek的Engram条件记忆模块在存储与推理之间做权衡,但依赖token级N-gram哈希,导致不同tokenizer需从头训练。论文提出用多项式哈希替换XOR哈希,建立跨N的联合嵌入空间。实验显示该改动在保持性能的同时实现tokenizer无关性,字节等价序列哈希相等。论文DeepseekEngramTokenizer推荐理由:DeepSeek改了Engram的哈希方式,不同tokenizer之间不用再各自训练,效果还一样,做多语言模型的可以看看。原文稍后读已读值得跟进有用关注 Deepseek
13:00向阳乔木@vista8Gated Delta Networks 是一种基于Mamba架构的新模型设计,被用于英伟达Nemotron、Kimi Delta Attention以及Qwen的最新模型中。这种混合架构通过融合注意力机制与状态空间模型,使得参数规模可达到万亿级别(T)的同时保持高推理质量。论文展示了其在长序列任务上的显著效率提升,相比纯Transformer架构可减少80%的计算开销。多款万亿参数模型已采用该架构,验证了其可扩展性。论文Gated Delta NetworksMambaNemotron推荐理由:这篇论文解释了为什么最近万亿参数模型(比如Nemotron、Kimi、Qwen)能又大又好——Gated Delta Networks混合了Mamba和注意力,效率翻倍还不掉精度。原文稍后读已读值得跟进有用关注 Gated Delta Networks
13:18小互@imxiaohu精选Anthropic内部对谈指出,模型外围的harness正在变薄,其编码的“模型做不到什么”的假设随模型能力提升而过期。旧harness像固定流水线,每个工位顺序执行任务。新harness更像战术教练,根据实际战况选择阵型。这种变化反映了模型能力跃迁后对控制框架的反思。AI模型AnthropicHarness模型架构4 个信源在谈事件专题推荐理由:Anthropic拆掉了模型外面那层死板的控制代码,换成能随机应变的教练。想了解模型架构演进,可以看看这篇对谈。原文稍后读已读值得跟进有用关注 Anthropic
13:13官方账号arXiv cs.AI@Reza Bayat, Ali Behrouz, Aaron Courville当前语言模型在深度上均匀分配参数,但研究表明各层贡献不同。该论文在固定预算下实验发现,将更多参数分配给前层、减少后层可以改进困惑度。提出Tapered Language Models(TLMs),通过余弦调度平滑锥形化MLP宽度。在Transformer、Gated Attention、Hope-attention和Titans四种架构上,三个模型尺度均一致提升困惑度和下游基准性能,且不增加参数或计算量。论文Tapered Language ModelsTransformerTitans推荐理由:这篇论文发现了一个简单技巧:同等算力下,把更多参数分给前几层、少给后几层,模型效果就能更好,试了多种架构都管用。原文稍后读已读值得跟进有用关注 Tapered Language Models
12:57官方一手歸藏(guizang.ai)@op7418精选71°Noam Shazeer(Transformer论文作者之一、MoE架构提出者)加入OpenAI,负责模型架构研究。谷歌此前以27亿美元收购Character.AI换取他加入谷歌。但Shazeer在谷歌停留短暂后即转投OpenAI。行业Noam ShazeerTransformerMoE10 个信源在谈事件专题推荐理由:Transformer论文作者Noam Shazeer,MoE提出者,跑到OpenAI研究模型架构了,谷歌27亿美元白花了?原文稍后读已读值得跟进有用关注 Noam Shazeer
23:12Philipp Schmid@_philschmid72°Google 昨日发布 Gemma 4 12B 模型,并附有详细架构图解。该模型创新性地移除了视觉和音频编码器,仅用一个 12B 参数模型即可处理文本、图像和音频,无需独立的编码器模块。图解展示了编码器通常如何连接模态与大语言模型,以及 Gemma 4 如何通过单一模型实现多模态理解。这一设计简化了模型结构,降低了部署复杂度,对多模态 AI 研究者和开发者具有重要参考价值。AI模型Gemma 4多模态模型架构10 个信源在谈事件专题推荐理由:多模态模型架构的一次简化尝试,做模型部署或边缘推理的团队值得看看图解,理解无编码器方案如何降低资源开销。原文稍后读已读值得跟进有用关注 Gemma 4
19:11官方账号arXiv cs.LG@Chenyang Song, Weilin Zhao, Xu Han, Chaojun Xiao, Yingfa Chen, Zhiyuan LiuDECO是一种针对端侧设备设计的稀疏MoE架构,旨在相同参数预算和训练Token数下达到稠密Transformer的性能。它采用可微分灵活的ReLU路由和可学习专家缩放,结合新激活函数NormSiLU,提高了路由专家激活比率的稳定性和内在稀疏性。实验显示,仅激活20%专家即可匹配稠密模型性能,专用加速核在真实硬件上相比稠密推理加速3倍。这一工作对推动MoE在资源受限设备上的实际部署具有重要意义。论文稀疏MoE端侧部署推理加速推荐理由:DECO在保持性能和降低计算开销方面取得了良好平衡,其3倍加速和严格的稀疏性控制对端侧AI部署具有实际参考价值。原文稍后读已读值得跟进有用关注 稀疏MoE