精选理由
阿里云新TTS模型有两个版本,一个快一个精,支持16种语言,还能用自然语言调风格,语音克隆也更强了。
阿里云发布最新语音合成模型Qwen-Audio-3.0-TTS,提供Flash和Plus两个版本。Flash针对实时交互场景优化,Plus侧重高质量生成。该模型支持16种语言的多语言覆盖,并引入自然语言风格控制功能。通过细粒度标签可控制非语言细节,如呼吸、停顿等。语音克隆能力增强,能从含噪或不完美音频中提取声音特征。
原文 · 阿里云 Alibaba Cloud
Qwen-Audio-3.0-TTS is here. 🎙️ Our latest text-to…
Qwen-Audio-3.0-TTS is here. 🎙️
Our latest text-to-speech model, in two flavors: • Flash: real-time interaction • Plus: high-quality generation
What's new: • Multilingual coverage across 16 languages • Style control in natural language • Fine-grained tags for non-verbal details • More robust voice cloning from imperfect audio
🔗 https://t.co/djyDePBiwV