模型10:58ScenA:基于参考语音的多说话人音频场景生成ScenA这个新方法能用参考语音和自然描述直接生成多人对话场景,比现有系统更自然,还带背景噪音和重叠说话。#ScenA#CoVoMix2-Dialogue#流匹配#多说话人aarXiv cs.AI@Michael Finkelson 等 10 人原文稍后读已读值得跟进有用关注 ScenA