11:32官方账号arXiv cs.AI@Zixun Guo, Simon Dixon人类能识别时移或转调的音乐,但标准音乐Transformer对这类输入会产生不相关表示。研究发现模型规模增大或训练时间更久时,等变性反而下降。为此提出EMT,通过自蒸馏联合优化下一token预测与辅助等变正则化损失。等变损失作为正则化器,同时提升预测能力和表示质量。在客观与主观评估中,EMT均超过数据增强、特征工程和SOTA基线。论文Equivariant Music Transformer音乐生成自蒸馏推荐理由:音乐Transformer换个调就认不出旋律,EMT用自蒸馏让它真正学到结构,生成效果还比SOTA好。原文稍后读已读值得跟进有用关注 Equivariant Music Transformer