ElevenLabs 的新 Turbo 版把语音质量做到榜单第一,价格还只有自家 v4 的一半,做语音相关的可以看看数据。
#文本转语音
共 17 条 · 7 天 1 条 · 30 天 5 条
信息流里打上「文本转语音」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月6日
ElevenLabs 旗下 Eleven v4 Turbo 登顶 Artificial Analysis 文本转语音榜单
10月2日
10月1日
9月24日
Google 发布 Gemini 3.8 Flash TTS 两款语音模型,支持 30 秒克隆自定义音色
Google 新出的 TTS 模型支持 30 秒音频克隆音色,还能让多个角色用不同声音对话,生成 1 分多钟音频只要 2.74 美分。
8月20日
8月10日
产品23:32
Fish Audio 上线 Voice Design,文本提示生成独特角色语音Fish Audio 出了个 Voice Design,写一句提示就能让角色说话,做配音的可以试试,和以前调参数完全不一样。
7月24日
7月23日
模型21:32
Deepgram Aura-2 发布,支持7种语言文本转语音Deepgram发布了Aura-2多语言TTS,能生成7种语言的语音,现已上架OpenRouter,适合需要多语种语音合成的场景。
6月19日
6月5日
6月4日
Miso Labs 发布 8B 情感 TTS 模型 MisoTTS,开放权重
MisoTTS 解决了 TTS 模型情感表达不足的痛点,做语音合成、虚拟助手或内容创作的团队可以直接下载权重试用,感受 8B 模型带来的细腻语调变化。
Miso One 开源:8B 参数情感语音模型,延迟仅 110ms
做语音合成或配音工具的开发者终于有了一个情感丰富且开源的 TTS 模型——Miso One 的 8B 参数和 110ms 延迟让实时配音成为可能,建议直接克隆仓库试试。
6月3日
模型04:44
MAI-Voice-2:15种语言情感可控TTS,支持长文本稳定音色做多语言内容或语音应用的团队终于有了一个能控制情绪、长文本不跑调的TTS模型,直接上OpenRouter就能用,值得试试。
6月2日
5月26日
5月15日
产品07:06
Rime Mist v3 登陆 Together AI,专为确定性发音和可控语音输出打造做语音代理和 TTS 应用的团队终于有了一个能保证发音一致性的生产级模型,直接在 Together AI 上就能部署,省去自己调教的麻烦,值得试试。