10:08orange.ai@oran_gePika本次推出Pika Soundtrack、Pika Speech、Pika Music和Pika SFX四款音频生成模型。Pika Soundtrack支持上传视频自动配音、配乐和加音效,价格为同行一半。Pika Speech是文生音TTS模型,价格同样为同行一半。Pika Music文生音乐价格仅为同行的十分之一,Pika SFX文生音效价格仅为同行的二十分之一。AI模型Pika音频生成TTS推荐理由:Pika一口气发了4款音频模型,配音、语音、音乐、音效齐了,价格最低压到同行的1/20,做应用开发的可以去看看接不接。原文稍后读已读值得跟进有用关注 Pika
11:57官方账号arXiv cs.AI@Oluwanifemi Bamgbose, Simon Rosen, Jash Shah, Lindsay Devon Brin, Hoang H Nguyen, Anke Koelzer, Rachel Hansen, Tara Bogavelli, Fanny RiolsarXiv论文提出首个维度级TTS元评估基准,将自然度拆解为10个语言学感知维度,包含860条由语言学家标注的语音样本。基准测试4个MOS预测器和4个Audio-LLM评判器后发现,MOS预测器仅反映声学信号质量,Audio-LLM评判器对特定提示有选择性检测且无法跨维度泛化。两类方法均不能可靠捕捉语言学结构化的语音错误。数据集、标注模式和评估代码已公开。论文TTSMOSAudio-LLM推荐理由:做TTS评测的可以看看,这篇把自然度拆成10个维度,实测发现MOS和Audio-LLM都测不全,还公开了数据集和代码。原文稍后读已读值得跟进有用关注 TTS
23:32Fish Audio@FishAudioFish Audio 发布 Voice Design 功能,用户只需输入一句文字提示,即可生成独特的角色语音。这个 Voice Design 工具把 TTS 变成一句话的事,不需要手动调音。官方在 X 上演示了用法,相关推文目前有 270 次查看。比起传统拟音流程,它更适合游戏角色或动画配音。AI产品FishAudioVoice DesignTTS推荐理由:Fish Audio 出了个 Voice Design,写一句提示就能让角色说话,做配音的可以试试,和以前调参数完全不一样。原文稍后读已读值得跟进有用关注 FishAudio
23:14Fish Audio@FishAudioFish Audio的多语言AI配音功能支持80余种语言。创作者可将视频内容配音为多种语言,面向全球观众分发。该功能基于其TTS技术,专为内容本地化设计。AI产品Fish AudioAI配音TTS推荐理由:Fish Audio现在能给你视频配上80多种语言的AI配音,想做海外市场的话,这个工具挺实用。原文稍后读已读值得跟进有用关注 Fish Audio
19:53Geek@geekbb一个9MB的Go二进制文件就能跑起整套24小时AI电台,内存占用仅20-30MB,连Raspberry Pi都带得动。它指向本地音乐文件夹后,由LLM规划歌单并撰写DJ台词,再用TTS合成人声。音频通过Icecast广播为192 kbps MP3流,任何播放器都能直接收听。项目发布在GitHub上,地址为github.com/johncrash64/ra……技巧GoRaspberry PiTTS推荐理由:想自己搭个AI电台?这个Go程序9MB就能跑,树莓派都能带,DJ说话和歌单全自动,自带LLM key就行。原文稍后读已读值得跟进有用关注 Go
11:28官方账号阿里云 Alibaba Cloud@alibaba_cloud阿里云发布了最新的语音技术Qwen-Audio-3.0-TTS模型,该模型已在OpenRouter平台上线。该模型支持更自然、更具表现力的语音合成,可用于提升音频交互体验。开发者可以通过OpenRouter API直接调用该模型,无需自行部署。AI模型Qwen-Audio-3.0-TTS阿里云语音合成推荐理由:阿里云新出的Qwen-Audio-3.0-TTS模型在OpenRouter上就能用,语音听起来更自然,做语音交互的可以试试。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS
03:10OpenRouter@OpenRouterAI阿里通义千问团队发布Qwen-Audio-3.0-TTS Flash,专为低延迟实时交互优化。该模型内置语音克隆功能,可处理质量不佳的参考音频。OpenRouter已上架该模型,支持API调用。AI模型Qwen-Audio-3.0-TTS-Flash阿里语音克隆推荐理由:阿里出了个新TTS,能实时克隆声音,连不好的录音都能用,交互时延迟很低。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS-Flash
21:58官方账号阿里通义 Qwen@Alibaba_Qwen71°阿里发布Qwen-Audio-3.0-TTS文本转语音模型,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签(如whisper、angry、breaths、laughs)和自由自然语言控制(如“读慢点像睡前故事”)。支持16种语言,能从嘈杂参考音频中生成干净输出。支持一次生成长达3分钟的语音。在Artificial Analysis TTS排行榜上位列第一。AI模型Qwen-Audio-3.0-TTS阿里TTS推荐理由:阿里出了个TTS新模型,能用标签控制笑声耳语,还能自然语言调语速,排行榜第一,支持16语言。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS
18:34量子位@梦晨阿里发布Qwen-Audio-3.0-TTS,在Global TTS Benchmark中位列第一。该模型支持20种中文方言合成,覆盖吴语、粤语、闽语等方言区。通过细粒度标签控制情感、语调、语速,实现高表现力语音生成。在MOS评分和自然度测试中超越GPT-4o等主流模型。AI模型Qwen-Audio-3.0-TTS阿里语音合成推荐理由:阿里出了个超强语音模型,能说20种方言,情感语调都能调,榜单第一,快去试试合成效果。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS
12:02官方账号arXiv cs.AI@Aastha Sharma, Guangjing WangVoxENES 2026是一个双语(英语和西班牙语)基准,包含53,628个音频样本,使用10种现代语音合成方法生成,在10种标准化后处理条件下评估。8个预训练检测器未经微调测试,最佳模型总体EER为28.98%,大多数接近或低于随机水平。结果凸显当前检测器依赖脆弱伪影,难以泛化到LLM驱动的TTS和语音转换。论文VoxENES 2026语音欺骗检测TTS推荐理由:新基准VoxENES 2026用5万多样本和10种现代语音合成方法,测了8个检测器,最佳EER才28.98%,说明现有检测器对LLM语音基本失效,做语音安全的朋友可以看看。原文稍后读已读值得跟进有用关注 VoxENES 2026
00:09shao__meng@shao__meng精选语音AI demo由STT→LLM→TTS组成,但生产系统需解决低延迟音频流、轮次检测、打断处理等编排问题。文章要求亚秒级往返延迟(STT+LLM+TTS+电话层≤1秒)、知识库有依据回答、实时上下文注入、转人工干净、不拨号可测试。方案用Telnyx AI Assistant Builder吸收管线,开发者仅写约15行FastAPI webhook。通过静态Instructions和Dynamic Variables拼接prompt,支持门户浏览器、真实PSTN号码、WebRTC三种测试方式。技巧TelnyxSTTLLM推荐理由:想搞生产级语音Agent?这篇拆了Telnyx的实战方案,15行webhook搞定上下文注入,还讲清了低延迟和测试细节。原文稍后读已读值得跟进有用关注 Telnyx
23:13berryxia@berryxia精选71°字节跳动通过BytePlus推出Seed Audio 1.0,这是一个非流式TTS模型,可在单次生成中同时输出语音、音乐和音效。该模型支持参考音频引导和图像引导音频生成,并能精细控制语速、音量、音调等参数。与仅处理语音的传统TTS不同,Seed Audio 1.0是一个多模态音频生成模型,适合复杂场景。目前仅对企业开放申请,早期反馈认为生成效果自然,但对音频时长缺乏精细控制。AI模型ByteDanceBytePlusSeed Audio 1.0推荐理由:字节跳动出了个全能音频生成模型,一次搞定语音、音乐、音效,还能用图片或参考音频引导,做短视频配乐超方便。原文稍后读已读值得跟进有用关注 ByteDance
19:03IT之家(博客/媒体)网易有道发布Confucius4-TTS,这是业内首个支持14种语言跨语种无口音的开源TTS模型。用户仅需提供3秒音频素材,无需参考文本即可完成零样本语音克隆,克隆音色与原声相似度超85%,准确度达97%。模型采用GPT式语义大模型搭配Flow Matching流匹配生成框架,支持音频Prompt情感克隆迁移,可跨语种保留语调韵律。全量开源(Apache协议),提供54GB完整资源包,商用无限制,适用于多语种内容生成、数字人配音等场景。AI模型Confucius4-TTS网易有道语音克隆推荐理由:网易新开源Confucius4-TTS,3秒克隆你的声音,还能用这个声音说14种外语没口音,全开源随便用,做配音超方便。原文稍后读已读值得跟进有用关注 Confucius4-TTS
11:32官方账号arXiv cs.AI@Harshit Singh, Ayush Pratap Singh, Nityanand Mathur流匹配TTS在部署后无法纠正专有名词的发音错误。FlowEdit通过潜在条件编辑而非权重更新来实现终身适应,并用现代Hopfield网络存储纠正。在涵盖18个语系、312个多语言专有名词的基准上,FlowEdit将目标词音素错误率相对降低92.7%,且通用语音质量不变。每次纠正仅需约15秒(单GPU)。论文FlowEditTTSHopfield Network推荐理由:想给TTS模型随时纠正陌生名词发音?FlowEdit用Hopfield网络存记忆,错误率直降92.7%,不用重训练。原文稍后读已读值得跟进有用关注 FlowEdit
13:10官方账号Guillaume Lample (Mistral)@GuillaumeLample精选73°Guillaume Lample 宣布推出首个语音模型 Voxtral TTS,该模型在性能上达到业界领先水平,同时大幅降低成本和延迟。它采用新架构,结合自回归生成语义语音令牌与流匹配生成声学令牌。团队还发布了技术报告,详细分享了训练方法和洞察。这标志着语音 AI 领域的重要进展,未来将有更多音频相关成果。AI模型语音模型TTS低成本推荐理由:Voxtral TTS 在成本和延迟上显著优于现有方案,做语音合成或实时语音应用的开发者可以直接关注,技术报告也值得细读。原文稍后读已读值得跟进有用关注 语音模型
10:41Ate-a-Pi@svpino一家顶尖语音AI提供商宣布将其TTS、STT和LLM的API价格全线降低50%。更吸引人的是,随着用户规模扩大,价格还会进一步下降。这一举措有望推动整个行业降价,对依赖语音AI的开发者来说是个好消息。AI产品语音AIAPI降价TTS推荐理由:语音AI成本直接减半,做语音应用或客服系统的团队现在可以大幅降低运营成本,建议立即评估是否切换或升级服务。原文稍后读已读值得跟进有用关注 语音AI
10:25官方账号arXiv cs.AI@Máté Gedeon, Péter Mihajlik低资源语言和垂直领域的对话式语音识别受限于多说话人训练数据稀缺。研究者提出一种数据增强流水线:先由LLM生成带参与者元数据的场景级对话,再将说话人属性映射到TTS语音配置,最后组装成说话人感知的合成对话。在匈牙利语BEA-Dialogue基准上,仅用67小时真实对话加636小时合成数据训练的模型,性能超过用2700小时真实语音训练的零样本模型。该方法适用于任何语言,且LLM生成器选择和合成数据组成对效果影响显著。论文语音识别数据增强低资源语言推荐理由:低资源语言ASR团队终于有了可落地的数据增强方案——用LLM+TTS生成对话数据,效果堪比数倍真实数据。做多说话人语音识别的开发者值得一试,尤其适合匈牙利语等小语种场景。原文稍后读已读值得跟进有用关注 语音识别
15:16向阳乔木@vista8网易有道持续开源其大模型,包括轻量级推理模型子曰-o1和数学模型子曰3,均支持单块消费级GPU运行。基于这些模型,有道已推出龙虾LobsterAI、同传Agent、Thinkflow等AI Agent产品。最新开源了全模态模型和TTS模型,标志着从教育垂直模型向AI Agent基础设施方向拓展。开源生态建设虽难但长期价值高,开发者可在线体验TTS和下载多模态模型。AI产品网易有道开源/仓库多模态模型推荐理由:网易有道从教育垂直模型转向AI Agent基建,开源的多模态和TTS模型让做Agent开发的团队可以直接用消费级GPU跑,值得关注其生态进展。原文稍后读已读值得跟进有用关注 网易有道
12:33官方账号Together AI@togethercomputeTogether AI 宣布在其平台上新增 600 多种声音,并集成了 MiniMax Speech 2.8 Turbo 企业级 TTS 模型。该模型专为实时、富有表现力的语音代理设计,支持 AI 原生开发者在其专用基础设施上部署。用户可以直接在语音查找器中试听这些声音。这一更新显著扩展了 Together AI 的语音能力,为构建语音交互应用提供了更多选择。AI产品TTS语音代理MiniMax推荐理由:做语音代理或实时对话应用的开发者,现在有 600+ 声音可选,且能直接在企业级基础设施上部署 MiniMax 模型,值得试试语音查找器里的新声音。原文稍后读已读值得跟进有用关注 TTS
09:25berryxia@berryxia牛津大学博士后、前Meta和Microsoft研究员Kevin Lin发布了开源视频翻译工具Violin。该工具将ASR、LLM翻译和TTS无缝集成,可自动完成语音识别、多语言翻译和自然语音合成。用户可个性化翻译风格,将学术报告转为通俗版本,还能直接与视频聊天提问。Violin支持Web应用、CLI和Agent Skill,完全MIT开源,旨在打破语言壁垒,让高质量内容全球化。AI产品视频翻译开源/仓库ASR推荐理由:做内容、教育或跨语言传播的团队,这个工具能一键解决视频翻译痛点,还能直接和视频对话,建议立刻装起来试试。原文稍后读已读值得跟进有用关注 视频翻译
07:06官方账号Together AI@togethercomputeTogether AI 宣布在其平台上推出 Rime Mist v3,这是一系列面向生产环境的文本转语音(TTS)模型。该模型专注于确定性发音和可控语音输出,解决了语音合成中常见的不一致问题。AI 原生开发者现在可以在 Together AI 的专用基础设施上部署 Mist v3,用于需要大规模一致语音输出的企业级语音代理。这为构建可靠、可定制的语音交互系统提供了新的选择。AI产品文本转语音TTS语音代理推荐理由:做语音代理和 TTS 应用的团队终于有了一个能保证发音一致性的生产级模型,直接在 Together AI 上就能部署,省去自己调教的麻烦,值得试试。原文稍后读已读值得跟进有用关注 文本转语音
03:42官方账号Together AI@togethercomputeTogether AI发布了Voice Finder工具,支持搜索、筛选和试听超过600种语音,覆盖主流TTS模型。用户可以通过描述需求或上传音频样本来快速找到适合应用的声音,显著提升AI语音应用的开发效率。该工具旨在帮助AI开发者更高效地集成语音功能,减少手动筛选的时间成本,推动语音交互应用的普及。AI产品语音合成TTS模型搜索推荐理由:该工具简化了语音选择流程,对开发者构建语音应用有直接帮助,尤其适用于需要多选项测试的场景。原文稍后读已读值得跟进有用关注 语音合成