8月11日
11:57
11:57官方账号arXiv cs.AI@Oluwanifemi Bamgbose, Simon Rosen, Jash Shah, Lindsay Devon Brin, Hoang H Nguyen, Anke Koelzer, Rachel Hansen, Tara Bogavelli, Fanny Riols
arXiv论文提出首个维度级TTS元评估基准,将自然度拆解为10个语言学感知维度,包含860条由语言学家标注的语音样本。基准测试4个MOS预测器和4个Audio-LLM评判器后发现,MOS预测器仅反映声学信号质量,Audio-LLM评判器对特定提示有选择性检测且无法跨维度泛化。两类方法均不能可靠捕捉语言学结构化的语音错误。数据集、标注模式和评估代码已公开。
推荐理由:做TTS评测的可以看看,这篇把自然度拆成10个维度,实测发现MOS和Audio-LLM都测不全,还公开了数据集和代码。
8月6日
23:14
7月24日
11:28
11:28官方账号阿里云 Alibaba Cloud@alibaba_cloud
阿里云发布了最新的语音技术Qwen-Audio-3.0-TTS模型,该模型已在OpenRouter平台上线。该模型支持更自然、更具表现力的语音合成,可用于提升音频交互体验。开发者可以通过OpenRouter API直接调用该模型,无需自行部署。
推荐理由:阿里云新出的Qwen-Audio-3.0-TTS模型在OpenRouter上就能用,语音听起来更自然,做语音交互的可以试试。
03:10
7月14日
12:02
12:02官方账号arXiv cs.AI@Aastha Sharma, Guangjing Wang
VoxENES 2026是一个双语(英语和西班牙语)基准,包含53,628个音频样本,使用10种现代语音合成方法生成,在10种标准化后处理条件下评估。8个预训练检测器未经微调测试,最佳模型总体EER为28.98%,大多数接近或低于随机水平。结果凸显当前检测器依赖脆弱伪影,难以泛化到LLM驱动的TTS和语音转换。
推荐理由:新基准VoxENES 2026用5万多样本和10种现代语音合成方法,测了8个检测器,最佳EER才28.98%,说明现有检测器对LLM语音基本失效,做语音安全的朋友可以看看。
6月19日
11:32
6月12日
13:10
13:10官方账号Guillaume Lample (Mistral)@GuillaumeLample
精选73°
Guillaume Lample 宣布推出首个语音模型 Voxtral TTS,该模型在性能上达到业界领先水平,同时大幅降低成本和延迟。它采用新架构,结合自回归生成语义语音令牌与流匹配生成声学令牌。团队还发布了技术报告,详细分享了训练方法和洞察。这标志着语音 AI 领域的重要进展,未来将有更多音频相关成果。

推荐理由:Voxtral TTS 在成本和延迟上显著优于现有方案,做语音合成或实时语音应用的开发者可以直接关注,技术报告也值得细读。
6月11日
10:41
10:41Ate-a-Pi@svpino
一家顶尖语音AI提供商宣布将其TTS、STT和LLM的API价格全线降低50%。更吸引人的是,随着用户规模扩大,价格还会进一步下降。这一举措有望推动整个行业降价,对依赖语音AI的开发者来说是个好消息。
推荐理由:语音AI成本直接减半,做语音应用或客服系统的团队现在可以大幅降低运营成本,建议立即评估是否切换或升级服务。
5月21日
5月15日