8月14日
16:26
16:26官方一手Pandaily@contact@pandaily.com (Pandaily)
中国语音AI创业公司VUI Labs的Luna-TTS模型在Hugging Face TTS Arena排行榜上位列第一,超越了ElevenLabs、MiniMax和Cartesia。在Artificial Analysis的Speech Arena榜单中,Luna-TTS排名第三,领先Google。该模型基于Qwen3的扩散架构,首包延迟仅为41.6毫秒。

推荐理由:VUI Labs的Luna-TTS登顶语音评测榜,延迟才41.6毫秒,比ElevenLabs还快,搞语音合成的该看看。
8月11日
00:35
00:35官方一手Hugging Face: Blog博客/媒体
精选
NVIDIA发布Magpie TTS,一个开放权重的多语言语音合成模型。该模型针对低延迟场景专门优化,适合部署实时语音代理。开发者通过开放权重可以完全控制部署流程,包括自定义推理配置。Magpie TTS支持多种语言,能用于构建跨语言交互系统。
事件专题

推荐理由:NVIDIA把Magpie TTS开放权重了,能自己控制部署,低延迟跑多语言语音代理,比闭源API灵活。
8月10日
22:23
22:23官方账号ElevenLabs@elevenlabsio
精选
德国电信在客服运营中采用ElevenLabs。语音质量成为用户是否继续与ElevenLabs的AI代理交谈的关键。ElevenLabs官方称,现在有更多客户让AI代理端到端解决咨询问题。
推荐理由:德国电信把客服语音换成ElevenLabs了,效果不错,更多用户愿意让AI直接解决问题,你不想看看吗?
7月24日
11:28
11:28官方账号阿里云 Alibaba Cloud@alibaba_cloud
阿里云发布了最新的语音技术Qwen-Audio-3.0-TTS模型,该模型已在OpenRouter平台上线。该模型支持更自然、更具表现力的语音合成,可用于提升音频交互体验。开发者可以通过OpenRouter API直接调用该模型,无需自行部署。
推荐理由:阿里云新出的Qwen-Audio-3.0-TTS模型在OpenRouter上就能用,语音听起来更自然,做语音交互的可以试试。
03:11
02:50
02:50OpenRouter@OpenRouterAI
OpenRouter 上线了微软的 MAI-Voice-2-Flash 模型,相比前代 MAI-Voice-2 推理速度提升2倍。该模型支持15种语言,保持自然韵律和声学质量,并提供细粒度语调控制。专为响应式语音助手和实时交互场景设计。
推荐理由:需要更快更自然的语音合成?微软新模型速度快两倍,15种语言随意切换,适合搭实时语音Agent。
7月15日
22:42
22:42Hailuo AI@Hailuo_AI
ElevenLabs推出Music v2,可从场景、风格和情绪提示生成任意类型音乐。Seed Audio 1.0支持从文本、参考音频或图像生成语音,并可调节速度、音量和音高。两个模型分别面向音乐和语音生成场景。

推荐理由:ElevenLabs同时更新了音乐和语音生成模型,Music v2能从提示生成任何风格音乐,Seed Audio 1.0支持图片转语音,玩法更多了。
7月2日
02:45
02:45官方账号xAI@xai
xAI发布了Voice Agent Builder,专为Grok Voice设计。传统语音系统需拼接语音转文本、语言模型及文本转语音三个API,每步切换增加成本、延迟与故障点。Voice Agent Builder将三个阶段紧密耦合至单一模型,减少跳转开销。该工具旨在优化实时语音交互体验。
推荐理由:xAI把语音转文字、大模型、文字转语音三个环节整合到一个接口里,延迟更低、故障更少,用Grok Voice搞语音交互的可以试试。
6月19日
01:29
6月16日
15:02
02:02
02:02Jerry Liu@jerryjliu0
Karan Goel 团队发布 Sonic-3.5(文本转语音)和 Ink-2(语音转文本)两种流式模型。新架构实现了速度和质量的突破,将两者推向各自类别的榜首。该团队自称是目前唯一同时拥有排名第一的语音输入和输出模型的提供商。
推荐理由:Karan Goel 发了两个新模型,Sonic-3.5 做 TTS 排名第一,Ink-2 做 STT 也是第一,说是唯一一家听说都做到顶的。做语音智能体的话看看。
6月3日
5月22日
5月21日
07:59
07:59官方账号ElevenLabs@elevenlabsio
ElevenLabs 宣布将阿尔伯特·爱因斯坦的语音引入平台,并推出一个基于其书面档案的智能体,能够以爱因斯坦标志性的声音进行互动。这一功能将语音智能体应用于教育领域,让用户能够与历史人物进行对话式学习,为知识传递带来全新维度。该智能体目前已在 ElevenLabs 上线,支持语音交互。
推荐理由:做教育科技或语音交互的团队值得关注——ElevenLabs 把历史人物语音化,让学习从单向阅读变成双向对话,直接可用的场景比想象中多。
5月13日
21:35
21:35官方一手MiniMax: News资讯
MiniMax 发布了其最新语音模型 Speech 2.8,在语音合成质量、自然度和实时性上均有显著提升。该模型支持多语言、多情感和多种说话风格,能够生成高度逼真的语音。Speech 2.8 在多个基准测试中表现优异,为语音交互、内容创作等场景提供了更强大的工具。
推荐理由:语音合成质量再上台阶,做语音助手、有声内容或虚拟主播的团队可以直接用上更自然的声音,建议体验一下效果。