阿里发布Qwen-Audio-3.0语音模型,ASR/TTS/实时交互全球第一

识别、合成、实时交互全球第一,Qwen-Audio-3.0 系列语音模型上线阿里千问 AI 平台

精选理由

阿里自家的新语音模型,ASR、TTS、实时对话都拿了全球第一,现在API直接能用。做语音应用的话值得试试。

AI 摘要

阿里云推出Qwen-Audio-3.0系列语音模型,包含ASR、TTS、Realtime三款,已上线千问AI平台和阿里云百炼平台。该系列在Artificial Analysis今年7月的语音排行榜中,拿下语音识别、实时交互、语音合成三个赛道全球第一。Qwen-Audio-3.0-ASR支持复杂语境和专业领域识别,Qwen-Audio-3.0-TTS支持多语种多方言并可控制情绪语气节奏。Qwen-Audio-3.0-Realtime支持端到端语音理解与对话,可边听边说、随时打断追问,并支持工具调用。

原文 · IT之家

识别、合成、实时交互全球第一,Qwen-Audio-3.0 系列语音模型上线阿里千问 AI 平台

IT之家 8 月 17 日消息,今天(17 日)下午,阿里云通过公众号宣布,Qwen-Audio-3.0 系列语音模型正式上线千问 AI 平台和阿里云百炼平台。 开发者可以通过 API 服务调用模型能力,也可以订阅 Token Plan 使用 。 Qwen-Audio-3.0 系列模型是阿里巴巴推出的自研语音模型。 IT之家 附具体的产品阵容如下: 语音识别大模型 Qwen-Audio-3.0-ASR 语音合成大模型 Qwen-Audio-3.0-TTS 实时语音交互对话模型 Qwen-Audio-3.0-Realtime 根据介绍,在全球权威 AI 评测平台 Artificial Analysis 今年 7 月的语音排行榜上,该模型斩获 语音识别(ASR)、实时交互(RealTime)和语音合成(TTS)三个赛道的全球第一 ,拿下“大满贯”。 其中,Qwen-Audio-3.0-ASR 将语音转为文字, 支持复杂语境和专业领域识别 ;Qwen-Audio-3.0-TTS 将文字转为语音, 支持多语种、多方言,可控制情绪、语气与节奏 ;Qwen-Audio-3.0-Realtime 支持端到端语音理解与对话, 可边听边说、随时打断追问,并支持工具调用 。 目前,该系列模型已在千问 App、千问办公、Qoder 等产品中应用。