9月1日
09:09
09:09官方账号arXiv cs.AI@Lingfeng Yao, Chenpei Huang, Xingke Yang, Ziye Geng, Changqing Luo, Hao Wang, Jiang Liu, Miao Pan
精选73°
PhysWave是一种物理引导的潜扩散模型,用于可控文本到一阶声学(FOA)音频生成。该模型通过可微分声学前验(球谐波方向一致性和反平方距离一致性)增强扩散训练,并构建了包含30万段FOA音频的数据集。实验结果表明,PhysWave在保持竞争力的音频质量的同时,能够生成空间一致性更好的FOA音频。
推荐理由:PhysWave统一了自然语言和轨迹控制,通过物理约束解决了现有方法违反声学关系的问题。