11:03官方账号arXiv cs.AI@Sandy Abdo, Bill Kapralos, Priyamvada Tripathi, KC Collins, Adam Dubrowski这篇综述从Google Scholar、IEEE Xplore和ACM数字图书馆筛选了30篇同行评审文章,系统梳理了文本、视觉、音频和多模态输入对生成音效质量的影响。过去五年中,多个生成模型在语义对齐和时间连贯性上达到SOTA水平。但复杂多事件场景的时序同步仍是难点,客观指标与人类感知存在差距,可控性和生成多样性之间也有权衡。论文音效生成多模态生成模型推荐理由:想了解AI怎么根据文字或画面生成音效?这篇综述把近五年的模型都梳理了一遍,还点出了哪些任务还没做好,适合做声音设计的人参考。原文稍后读已读值得跟进有用关注 音效生成