MC-Sparse:训练-free 稀疏注意力框架缩小 DiT 稠密稀疏差距
一篇实用论文:MC-Sparse 不用训练就能把视频和 3D 生成的去噪提速 1.8 到 2.3 倍,还指出了以往稀疏注意力掉质量的三个原因。
一篇实用论文:MC-Sparse 不用训练就能把视频和 3D 生成的去噪提速 1.8 到 2.3 倍,还指出了以往稀疏注意力掉质量的三个原因。
这篇论文提出了ChebBooster,一种基于切比雪夫多项式的训练免费外推框架,能显著提升扩散Transformer的推理效率,值得一看。
这篇论文把LLM里高效扩展的思路用到了扩散Transformer上,MMOE在单机8卡H100就跑出了更低的FID,比加参数更实用。
想给图像或视频扩散模型做低位量化?OrbitQuant不需要每换一个模型或任务就重跑校准,FLUX.1、Wan 2.1上表现都很能打,W2A4也有可用效果。
做视频生成和相机运动控制的团队终于有了一个无需配对数据就能克隆多镜头相机运动的方案——OmniDirector 用网格运动视频统一了相机表示,直接在百万级数据上训练,效果比依赖合成配对数据的方法好很多,做视频编辑和影视制作的开发者值得关注。
机器人操控研究者终于有了一个能高效解耦世界建模与动作执行的方案——AHA-WAM在速度和成功率上双赢,做具身智能的团队可以直接参考其异步架构设计。