16:52小互@imxiaohu76°通义推出 Qwen-Audio-3.0-TTS 语音模型,支持 16 种语言和 20 种方言。首包延迟仅 300 毫秒级。同一段参考音可跨 16 种语言保持音色一致。在 CV3-Eval 基准上,说话人相似度 16 个语种全部排第一,Plus 平均得分 82.75 分(百分制)。AI模型Qwen-Audio-3.0-TTS通义语音合成推荐理由:通义新出的语音模型,一段音就能说16种语言,还能保持音色,延迟才300毫秒,挺实用的。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS
11:32官方账号阿里云 Alibaba Cloud@alibaba_cloud阿里云发布最新语音合成模型Qwen-Audio-3.0-TTS,提供Flash和Plus两个版本。Flash针对实时交互场景优化,Plus侧重高质量生成。该模型支持16种语言的多语言覆盖,并引入自然语言风格控制功能。通过细粒度标签可控制非语言细节,如呼吸、停顿等。语音克隆能力增强,能从含噪或不完美音频中提取声音特征。AI模型Qwen-Audio-3.0-TTSAlibaba Cloud语音合成推荐理由:阿里云新TTS模型有两个版本,一个快一个精,支持16种语言,还能用自然语言调风格,语音克隆也更强了。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS
18:34量子位@梦晨阿里发布Qwen-Audio-3.0-TTS,在Global TTS Benchmark中位列第一。该模型支持20种中文方言合成,覆盖吴语、粤语、闽语等方言区。通过细粒度标签控制情感、语调、语速,实现高表现力语音生成。在MOS评分和自然度测试中超越GPT-4o等主流模型。AI模型Qwen-Audio-3.0-TTS阿里语音合成推荐理由:阿里出了个超强语音模型,能说20种方言,情感语调都能调,榜单第一,快去试试合成效果。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS
16:57IT之家(博客/媒体)阿里千问发布语音合成大模型Qwen-Audio-3.0-TTS,包含Flash(首包延时300ms级别)和Plus两个版本。在Artificial Analysis全球榜单中,Qwen-Audio-3.0-TTS-Plus位列第一。模型支持在文本嵌入[gasp]、[giggles]等结构化标签精细控制语气情绪。覆盖中、英、日、韩、德等16种语言及20种方言,音频输出提升至48KHz,单次合成可达3分钟。AI模型Qwen-Audio-3.0-TTS阿里千问语音合成推荐理由:阿里千问新语音模型能通过标签控制语气情绪,支持16种语言和20种方言,48KHz音质,试试让语音笑或生气。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS