#MLA
共 6 条 · 7 天 1 条 · 30 天 1 条
信息流里打上「MLA」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月6日
7月28日
MLA瓶颈分离内容与位置:DeepSeek-V2注意力机制可解释性研究
想看MLA到底怎么工作的?这篇论文用114M模型做实验,发现cKV只记内容不记位置,还能省81%缓存,归纳头也全挤在一层,挺有意思的。
7月21日
训练内存回归:Megatron-Core禁止MLA吸收模式的原因及LAGA修复
这篇论文解释了为什么Megatron-Core的MLA吸收模式在训练时会导致内存暴增,还给出了一个叫LAGA的修复方法,通信更省,速度和内存几乎没损失。
6月2日
Move the Query, Not the Cache:跨实例 MLA 注意力新策略
做大规模 LLM 推理部署的团队,这篇论文给出了跨 GPU 注意力优化的新思路——路由查询而非移动缓存,实测能大幅降低延迟。建议关注其成本模型和决策谓词,可直接用于优化自家推理系统。
5月29日
VideoMLA:低秩潜变量KV缓存实现分钟级自回归视频扩散
视频生成团队终于有了解决长序列KV缓存内存爆炸的方案——VideoMLA将内存减少92.7%且不牺牲质量,做长视频扩散的开发者可以直接在B200上试,吞吐量提升1.23倍。
5月23日
OpenMythos 教程:构建循环深度 Transformer,支持 MLA、GQA、稀疏 MoE 和循环缩放推理
想低成本在 Colab 里跑循环深度 Transformer 的研究者可以直接上手——OpenMythos 把 MLA、GQA、稀疏 MoE 这些前沿结构打包成了可复现的教程,做注意力机制或推理效率优化的团队值得点开。