7月23日
11:29
11:29官方账号arXiv cs.AI@Junyu Dai, Xinyue Fan, Weiqin Li, Xiangang Li, Yunjia Li, Bin Ma, Yukun Ma, Chongjia Ni, Yufei Shi, Haoxu Wang, Menglin Wu, Jianwei Yu, Huaicheng Zhang, Han Zhao, Shengkui Zhao, Haina Zhu
本文提出一个统一的全歌曲生成框架,支持从歌词、文本描述和音乐属性生成完整歌曲。该框架包含四个组件:语义感知分词器将音频编码为8码本RVQ令牌,hybird-LM进行层次化自回归音频令牌建模,FullDiT在连续VAE潜空间中执行流匹配渲染,两级旋律模块用于翻唱生成。在人工分析音乐带歌声排行榜上取得竞争性能,并探索了DPO、GRPO和OPD作为后训练策略。实验在多语言自动基准上进行评估。
推荐理由:这篇论文提出了一个能生成完整歌曲的框架,支持歌词生成、纯音乐和翻唱,还在排行榜上验证了效果,音乐生成方向的同学可以看看。