#TTS
共 64 条 · 7 天 9 条 · 30 天 41 条
9月14日
9月3日
8月15日
模型10:08
Pika发布4款声音模型,覆盖配音、语音、音乐、音效,价格低至同行1/20Pika一口气发了4款音频模型,配音、语音、音乐、音效齐了,价格最低压到同行的1/20,做应用开发的可以去看看接不接。
8月11日
论文11:57
TTS评估新基准:10维度拆解自然度,MOS与Audio-LLM各有短板做TTS评测的可以看看,这篇把自然度拆成10个维度,实测发现MOS和Audio-LLM都测不全,还公开了数据集和代码。
8月10日
产品23:32
Fish Audio 上线 Voice Design,文本提示生成独特角色语音Fish Audio 出了个 Voice Design,写一句提示就能让角色说话,做配音的可以试试,和以前调参数完全不一样。
8月6日
8月5日
7月24日
阿里云发布Qwen-Audio-3.0-TTS语音模型,已上线OpenRouter
阿里云新出的Qwen-Audio-3.0-TTS模型在OpenRouter上就能用,语音听起来更自然,做语音交互的可以试试。
7月23日
7月20日
7月14日
论文12:02
VoxENES 2026:评估语音欺骗检测器在LLM时代TTS和语音转换上的泛化新基准VoxENES 2026用5万多样本和10种现代语音合成方法,测了8个检测器,最佳EER才28.98%,说明现有检测器对LLM语音基本失效,做语音安全的朋友可以看看。
6月30日
6月23日
模型19:03
网易开源Confucius4-TTS:3秒音频克隆音色,14种语言无口音网易新开源Confucius4-TTS,3秒克隆你的声音,还能用这个声音说14种外语没口音,全开源随便用,做配音超方便。
IT之家原文
6月19日
6月12日
6月11日
6月3日
论文10:25
用从未发生的对话训练ASR:合成对话提升低资源语言识别低资源语言ASR团队终于有了可落地的数据增强方案——用LLM+TTS生成对话数据,效果堪比数倍真实数据。做多说话人语音识别的开发者值得一试,尤其适合匈牙利语等小语种场景。
5月26日
产品15:16
网易有道开源多模态与TTS模型,转向AI Agent基建网易有道从教育垂直模型转向AI Agent基建,开源的多模态和TTS模型让做Agent开发的团队可以直接用消费级GPU跑,值得关注其生态进展。
5月21日
产品12:33
Together AI 新增 600+ 声音,集成 MiniMax Speech 2.8 Turbo做语音代理或实时对话应用的开发者,现在有 600+ 声音可选,且能直接在企业级基础设施上部署 MiniMax 模型,值得试试语音查找器里的新声音。
5月15日
产品07:06
Rime Mist v3 登陆 Together AI,专为确定性发音和可控语音输出打造做语音代理和 TTS 应用的团队终于有了一个能保证发音一致性的生产级模型,直接在 Together AI 上就能部署,省去自己调教的麻烦,值得试试。
5月13日