03:26官方账号ElevenLabs@elevenlabsio精选ElevenLabs推出的文本转语音服务已登陆ElevenAgents和ElevenAPI平台。该服务以每千字符0.05美元收费,规模扩大后费用更低。与同类AI语音转换服务相比,该服务性价比突出。AI产品ElevenLabs文本转语音ElevenAgents推荐理由:ElevenLabs出了文本转语音服务,在两个平台能用,每千字符才五毛,比好多同类服务便宜。原文稍后读已读值得跟进有用关注 ElevenLabs
23:32Fish Audio@FishAudioFish Audio 发布 Voice Design 功能,用户只需输入一句文字提示,即可生成独特的角色语音。这个 Voice Design 工具把 TTS 变成一句话的事,不需要手动调音。官方在 X 上演示了用法,相关推文目前有 270 次查看。比起传统拟音流程,它更适合游戏角色或动画配音。AI产品FishAudioVoice DesignTTS推荐理由:Fish Audio 出了个 Voice Design,写一句提示就能让角色说话,做配音的可以试试,和以前调参数完全不一样。原文稍后读已读值得跟进有用关注 FishAudio
03:11OpenRouter@OpenRouterAI阿里通义千问推出 Qwen-Audio-3.0-TTS Plus,这是其 TTS 模型的高质量版本。该模型在自然度、声音和音色保真度上进行了优化,支持多种语言和说话风格。相比前代,Plus 版本生成语音更加精细且富有表现力。用户可通过 OpenRouter 平台调用该模型。AI模型Qwen-Audio-3.0-TTS PlusQwen阿里推荐理由:阿里刚发了Qwen-Audio-3.0-TTS Plus,语音更自然好听,还支持多语言和不同风格,做语音合成的可以试试。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS Plus
21:32OpenRouter@OpenRouterAIDeepgram推出Aura-2多语言文本转语音模型。该模型基于Deepgram的规范Aura-2语音目录,支持英语、西班牙语、德语、法语、荷兰语、意大利语和日语共7种语言。用户可通过OpenRouter平台使用此服务。AI模型DeepgramAura-2OpenRouter推荐理由:Deepgram发布了Aura-2多语言TTS,能生成7种语言的语音,现已上架OpenRouter,适合需要多语种语音合成的场景。原文稍后读已读值得跟进有用关注 Deepgram
01:29官方账号xAI@xai精选Vapi 的 Humanness Index 盲测显示,xAI 的 Grok TTS 模型以 96 分(满分 100)位居榜首,仅比人类真实语音低 4 分。该测试将同一段语音用不同模型克隆后,让听众盲评打分。Grok TTS 在多家主要语音模型中表现最接近真人。AI模型Grok TTSxAI语音合成推荐理由:xAI 的 Grok TTS 在语音盲测中拿了 96 分,离真人只差 4 分,想听最像人说话的 AI 可以试试。原文稍后读已读值得跟进有用关注 Grok TTS
18:33Geek@geekbbMisoLabsAI 开源了一个 80 亿参数的情感丰富文本转语音模型,专注于高质量对话语音生成。该模型目前仅支持英语,但能生成带有情感色彩的语音,适合对话场景。项目上线三天即获得 1.7K GitHub Star,引发社区关注。这标志着开源 TTS 在情感表达和对话质量上迈出了重要一步。AI模型文本转语音情感模型开源/仓库推荐理由:做语音交互或对话式 AI 的开发者,这个开源模型能直接提升语音的自然度和情感表现力,值得立刻试一下。原文稍后读已读值得跟进有用关注 文本转语音
16:15官方一手marktechpost@Asif Razzaq精选Miso Labs 发布了 MisoTTS,一个 8B 参数的开源文本转语音模型,专注于情感表达。它采用残差向量量化(RVQ)技术,在不增加参数的情况下扩展声音范围,并能根据文本和音频上下文调整说话人语调。模型架构由 7.7B 主骨干和 300M 深度解码器组成。MisoTTS 的开放权重让开发者和研究者可以自由使用和定制,推动了情感语音合成领域的开源进展。AI模型文本转语音情感合成开源模型推荐理由:MisoTTS 解决了 TTS 模型情感表达不足的痛点,做语音合成、虚拟助手或内容创作的团队可以直接下载权重试用,感受 8B 模型带来的细腻语调变化。原文稍后读已读值得跟进有用关注 文本转语音
02:55elvis@omarsar078°Miso One 是一个 8B 参数的开源文本转语音模型,具备真实情感范围,能表达温暖、犹豫和兴奋等情绪,告别机械感。它专为短视频、播客和教育内容等配音场景设计,推理延迟仅 110 毫秒,快于人类反应时间。模型权重完全开源,支持自托管、微调和数据隐私保护,适合将语音集成到工具和产品的开发者。AI模型Miso One文本转语音情感语音推荐理由:做语音合成或配音工具的开发者终于有了一个情感丰富且开源的 TTS 模型——Miso One 的 8B 参数和 110ms 延迟让实时配音成为可能,建议直接克隆仓库试试。原文稍后读已读值得跟进有用关注 Miso One
04:44OpenRouter@OpenRouterAI微软发布MAI-Voice-2,一款支持15种语言的情感可控文本转语音模型,可表达兴奋、尴尬、耳语等情绪,并在长文本中保持稳定的说话人身份。该模型与MAI-Transcribe-1.5语音识别模型搭配使用,已在OpenRouter上线。这为多语言内容创作、有声读物、语音助手等场景提供了更自然、富有表现力的语音合成能力。AI模型微软MAI-Voice-2文本转语音推荐理由:做多语言内容或语音应用的团队终于有了一个能控制情绪、长文本不跑调的TTS模型,直接上OpenRouter就能用,值得试试。原文稍后读已读值得跟进有用关注 微软
23:59官方账号ElevenLabs@elevenlabsio精选ElevenLabs在华沙Summit上预览了设备端文本转语音(on-device TTS)新模型架构,能在有限硬件上离线实现人类级质量。该模型不需要互联网连接,直接在设备上运行。具体硬件要求和延迟数据未在原文中透露。AI产品ElevenLabs文本转语音离线推荐理由:离线语音合成,质量媲美真人原文稍后读已读值得跟进有用关注 ElevenLabs
16:06官方一手marktechpost@Michal SutterOmniVoice Studio 是一个完全本地运行的开源语音工具,无需 API 密钥、云账户或订阅。它支持语音克隆、视频配音、实时听写和说话人分离,覆盖 646 种语言的文本转语音。项目还提供 MCP 服务器,可与 Claude、Cursor 等客户端集成。这为追求隐私和低成本的语音处理需求提供了强大替代方案。AI产品语音克隆开源/仓库MCP/工具8 个信源在谈事件专题推荐理由:做语音应用或内容创作的团队终于有了本地可用的开源方案,隐私安全且零成本,建议试试集成到工作流中。原文稍后读已读值得跟进有用关注 语音克隆
07:06官方账号Together AI@togethercomputeTogether AI 宣布在其平台上推出 Rime Mist v3,这是一系列面向生产环境的文本转语音(TTS)模型。该模型专注于确定性发音和可控语音输出,解决了语音合成中常见的不一致问题。AI 原生开发者现在可以在 Together AI 的专用基础设施上部署 Mist v3,用于需要大规模一致语音输出的企业级语音代理。这为构建可靠、可定制的语音交互系统提供了新的选择。AI产品文本转语音TTS语音代理推荐理由:做语音代理和 TTS 应用的团队终于有了一个能保证发音一致性的生产级模型,直接在 Together AI 上就能部署,省去自己调教的麻烦,值得试试。原文稍后读已读值得跟进有用关注 文本转语音