AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
全部 AI 动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
标签:长序列生成×
6月16日
20:46
AITOP6月16日 20:46
600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI
6月12日
12:57
AITOP6月12日 12:57
Claude代码里藏了个20260612,18个月后的AI记忆革命已经开始倒计时
6月11日
15:28
AITOP6月11日 15:28
1107 vs 303:谷歌悄悄开源了一个“拆打字机”的模型,把大模型速度翻了4倍
15:23
AITOP6月11日 15:23
DiffusionGemma颠覆文本生成?自回归模型的“统治”要结束了
15:07
AITOP6月11日 15:07
每秒1107个token,Google开源的扩散模型为什么能改变本地推理格局?
5月29日
11:05
11:05arXiv cs.AI@Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Hoda Eldardiry, Pinar Yanardag
精选
VideoMLA首次将多头潜注意力(MLA)应用于视频扩散模型,通过共享低秩内容潜变量和分离的3D-RoPE位置键,将每个token的KV缓存内存减少92.7%。研究发现,尽管视频注意力并非低秩(99%能量有效秩远超实际潜变量维度),但MLA瓶颈决定了有效秩,而非预训练频谱,从而在压缩比下保持质量。在VBench基准上,VideoMLA在短时视频扩散中匹配基线,在长时任务中取得最佳综合得分,并在单块B200上实现1.23倍吞吐量提升。该工作解决了长序列视频生成中KV缓存内存和延迟瓶颈,为分钟级视频扩散提供了高效方案。
论文视频扩散KV缓存低秩注意力MLA长序列生成

推荐理由:视频生成团队终于有了解决长序列KV缓存内存爆炸的方案——VideoMLA将内存减少92.7%且不牺牲质量,做长视频扩散的开发者可以直接在B200上试,吞吐量提升1.23倍。
原文
精选全部日报登录