Qwen-Audio-3.0-TTS 发布:Flash实时交互,Plus高质量生成

Qwen-Audio-3.0-TTS is here. 🎙️ Our latest text-to…

精选理由

阿里云新TTS模型有两个版本,一个快一个精,支持16种语言,还能用自然语言调风格,语音克隆也更强了。

AI 摘要

阿里云发布最新语音合成模型Qwen-Audio-3.0-TTS,提供Flash和Plus两个版本。Flash针对实时交互场景优化,Plus侧重高质量生成。该模型支持16种语言的多语言覆盖,并引入自然语言风格控制功能。通过细粒度标签可控制非语言细节,如呼吸、停顿等。语音克隆能力增强,能从含噪或不完美音频中提取声音特征。

原文 · 阿里云 Alibaba Cloud

Qwen-Audio-3.0-TTS is here. 🎙️ Our latest text-to…

Qwen-Audio-3.0-TTS is here. 🎙️

Our latest text-to-speech model, in two flavors: • Flash: real-time interaction • Plus: high-quality generation

What's new: • Multilingual coverage across 16 languages • Style control in natural language • Fine-grained tags for non-verbal details • More robust voice cloning from imperfect audio

🔗 https://t.co/djyDePBiwV

Qwen-Audio-3.0-TTS 发布:Flash实时交互,Plus高质量生成 · AI 热点