AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

MLA

共 5 条相关 AI 资讯
7月28日
11:35
11:35官方一手arXiv: DeepSeek@Dhruvil S, Fenil Sojitra, Ravirajsinh Chauhan
精选
论文首次对DeepSeek-V2引入的多头潜在注意力(MLA)进行全面的可解释性分析。研究者训练了一个114M参数的Transformer,在TinyStories上微调后通过SVD、线性探针等方法发现:共享低秩瓶颈cKV保留了98%的实体身份信息,几乎完全丢弃位置信息,实现了81%的KV缓存压缩。归纳头集中在第12层,而标准多头注意力中它们分布在不同层。瓶颈平均仅使用46%的容量,存在过度配置。这些结果揭示了MLA并非被动压缩,而是主动重塑了模型的内容组织、位置编码和电路结构。
论文MLADeepSeek-V2可解释性

推荐理由:想看MLA到底怎么工作的?这篇论文用114M模型做实验,发现cKV只记内容不记位置,还能省81%缓存,归纳头也全挤在一层,挺有意思的。
原文
7月21日
11:42
11:42官方一手arXiv: DeepSeek@Changzheng Ma
精选73°
论文揭示Megatron-Core中MLA吸收模式被禁止训练的原因:在DeepSeek-V3规模(n_h=128, seq=16384, SP=8)下,其激活内存比显式形式膨胀20-34%,最高达9.2 GB(eager kernel)或19.2 GB(fused kernel)。该限制在A100上交叉验证,原因在于中间变量维度为n_h×d_kv而非每头K/V。论文提出LAGA方法,在8x Ascend 910B上保持吸收模式的潜变量通信,但本地重建每头K/V:通信削减1.98倍,内存仅增加0.5%,SP=1时位精确,SP=2-8时误差≤1e-3,注意力块吞吐提升1.04-1.06x(单节点)和1.07-1.24x(跨节点)。
论文MLAMegatron-CoreLAGA

推荐理由:这篇论文解释了为什么Megatron-Core的MLA吸收模式在训练时会导致内存暴增,还给出了一个叫LAGA的修复方法,通信更省,速度和内存几乎没损失。
原文
6月2日
12:05
12:05官方一手arXiv: DeepSeek@Bole Ma, Jan Eitzinger, Harald Köstler, Gerhard Wellein
72°
本文研究跨 GPU 实例的注意力机制优化问题。传统方法在查询需要访问其他 GPU 上的 KV 缓存块时,会移动缓存块到查询所在 GPU,但多查询注意力(MLA)将每个 token 的键和值压缩为窄向量,使得路由查询(约 1KB)比移动缓存块更便宜。作者在真实多节点 H100 集群上测量了跨实例 MLA 注意力,提出了拓扑感知成本模型和路由/获取/本地决策谓词,发现解码时路由查询可将缓存移动的约 3 毫秒开销降低到几十微秒。该模型不限于 MLA,可推广到 DeepSeek-V3.2、V4 和 GLM-5.1 等架构。
论文注意力机制MLA跨实例推理

推荐理由:做大规模 LLM 推理部署的团队,这篇论文给出了跨 GPU 注意力优化的新思路——路由查询而非移动缓存,实测能大幅降低延迟。建议关注其成本模型和决策谓词,可直接用于优化自家推理系统。
原文
5月29日
11:05
11:05官方账号arXiv cs.AI@Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Hoda Eldardiry, Pinar Yanardag
精选
VideoMLA首次将多头潜注意力(MLA)应用于视频扩散模型,通过共享低秩内容潜变量和分离的3D-RoPE位置键,将每个token的KV缓存内存减少92.7%。研究发现,尽管视频注意力并非低秩(99%能量有效秩远超实际潜变量维度),但MLA瓶颈决定了有效秩,而非预训练频谱,从而在压缩比下保持质量。在VBench基准上,VideoMLA在短时视频扩散中匹配基线,在长时任务中取得最佳综合得分,并在单块B200上实现1.23倍吞吐量提升。该工作解决了长序列视频生成中KV缓存内存和延迟瓶颈,为分钟级视频扩散提供了高效方案。
论文视频扩散KV缓存低秩注意力

推荐理由:视频生成团队终于有了解决长序列KV缓存内存爆炸的方案——VideoMLA将内存减少92.7%且不牺牲质量,做长视频扩散的开发者可以直接在B200上试,吞吐量提升1.23倍。
原文
5月23日
17:52
17:52官方一手marktechpost@Sana Hassan
本文是一篇教程,介绍如何使用 OpenMythos 框架构建循环深度 Transformer 模型,并在 Google Colab 中端到端运行。教程涵盖了多头潜在注意力(MLA)、分组查询注意力(GQA)、稀疏混合专家(MoE)和循环缩放推理等高级特性。作者通过构建 MLA 和 GQA 两种变体,对比了它们的参数量,并通过谱半径检查了循环注入矩阵的稳定性。该教程为研究人员和开发者提供了在有限资源下探索循环深度 Transformer 的实用指南。
论文循环深度 TransformerOpenMythosMLA

推荐理由:想低成本在 Colab 里跑循环深度 Transformer 的研究者可以直接上手——OpenMythos 把 MLA、GQA、稀疏 MoE 这些前沿结构打包成了可复现的教程,做注意力机制或推理效率优化的团队值得点开。
原文
精选全部日报登录