精选理由
通义新出的语音模型,一段音就能说16种语言,还能保持音色,延迟才300毫秒,挺实用的。
通义推出 Qwen-Audio-3.0-TTS 语音模型,支持 16 种语言和 20 种方言。首包延迟仅 300 毫秒级。同一段参考音可跨 16 种语言保持音色一致。在 CV3-Eval 基准上,说话人相似度 16 个语种全部排第一,Plus 平均得分 82.75 分(百分制)。
原文 · 小互
通义发布 Qwen-Audio-3.0-TTS 语音模型 一段参考音能说 16 种语言和 20 种方言 首包延迟做到 300 毫秒级 同一段参考音可以跨 16 种语言念,音色不走样:CV3-Ev...
通义发布 Qwen-Audio-3.0-TTS 语音模型 一段参考音能说 16 种语言和 20 种方言 首包延迟做到 300 毫秒级 同一段参考音可以跨 16 种语言念,音色不走样:CV3-Eval 上说话人相似度 16 个语种全部排第一,Plus 平均 82.75 分(百分制,越接近 100 越像本人)。 best.xiaohu.ai/article/qwen-a… 💬 3 🔄 0 ❤️ 3 👀 1072 📊 4 ⚡