8月6日
09:23
09:23官方账号arXiv cs.LG@Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu
TD-V2A是一种基于扩散模型的视频到音频生成方法,利用时间差异作为区分视频与图像的关键表示。研究对比了帧级和特征级的时间差异,发现特征级更有效。该方法引入分层持续学习策略和退火时间差异引导,在基准数据集上取得优于对比音视频预训练的效果。
推荐理由:这篇论文提出用时间差异做视频生成音频,不用额外网络,效果还超过了对比预训练方法,值得做V2A的人看看。