11:04官方账号arXiv cs.LG@Youjun Zhao, Alex Warren, Gary K. L. Tam, Rynson W. H. LauMirrorWorld 提出一种反射感知的视频修复框架,用于解决视频扩散模型生成镜像反射时内容不一致的问题。其引入语义关系蒸馏(SRD),借助冻结的视觉基础模型将可见场景与镜像区域的语义关联传递给生成过程。同时设计几何变换对齐(GTA)模块,学习反射内容在镜面内的空间排列变换。在由四个现有视频镜像数据集统一构建的基准上,MirrorWorld 的反射重建质量优于基于图像的反射生成方法和强视频修复基线。论文MirrorWorld视频扩散模型镜像反射推荐理由:MirrorWorld 把镜像反射生成做成视频修复任务,用 SRD 和 GTA 分别管反射内容和位置,效果比图像方法和视频修复基线都好。原文稍后读已读值得跟进有用关注 MirrorWorld
11:31官方账号arXiv cs.LG@Jorge Diaz Chao, Konpat Preechakul, Yuxi Liu, Yutong Bai论文通过多球硬球动力学实验发现,标准双向视频扩散模型在因果链长度增加时性能显著下降,即使增加去噪步数也无法缓解。长度匹配的单球控制实验排除了视频长度的影响,证明依赖事件结构才是主因。自回归/逐块生成和增加架构深度等方法能有效提升序列推理性能,但去噪步数本身不增加序列计算。作者将此模式定义为序列性差距,并证明确定性视频预测中,去噪步数无法提供可扩展的序列计算能力。论文视频扩散模型Seriality Gap多球硬球动力学推荐理由:这篇论文用多球碰撞实验揭示了视频扩散模型做因果推理时的短板,增加去噪步数没用,但自回归和加深网络有效。对做视频生成和物理模拟的人很有启发。原文稍后读已读值得跟进有用关注 视频扩散模型
14:01AK@_akhaliqNVIDIA 在 Hugging Face 上发布了 AnyFlow,这是首个任意步数视频扩散模型。它能够根据文本描述生成高质量视频,且支持在推理时灵活调整步数,无需重新训练。该模型在视频质量和生成效率上取得了平衡,为视频生成领域带来了新的可能性。开发者可以直接在 Hugging Face 上获取模型权重和使用示例。AI模型NVIDIAAnyFlow视频扩散模型推荐理由:做视频生成或扩散模型研究的开发者,现在有了一个无需重新训练就能灵活控制生成步数的工具,值得上手试试。原文稍后读已读值得跟进有用关注 NVIDIA