谷歌新出的两款 TTS 模型能逐行控制台词语气,还能用 30 秒录音复制声音,做播客有声书的朋友可以去 AI Studio 试试。
#语音合成
阿里 Qwen 把语音识别、合成、实时对话打包成五个模型一起发,ASR 最高打 0.5 折,做播客或有声书的可以试试 TTS-Next。
阿里这次一口气发了五款语音模型,方言识别和能自己生成配乐音效的 TTS-Next 都挺有意思,价格还砍了一波。
Fish Audio 出了 MCP 接入文档,跟着 docs.fish.audio/overview/mcp 走一遍,你的智能体就能开口说话了。
VUI Labs的Luna-TTS登顶语音评测榜,延迟才41.6毫秒,比ElevenLabs还快,搞语音合成的该看看。
阿里云新出的Qwen-Audio-3.0-TTS模型在OpenRouter上就能用,语音听起来更自然,做语音交互的可以试试。
阿里千问新语音模型能通过标签控制语气情绪,支持16种语言和20种方言,48KHz音质,试试让语音笑或生气。
ElevenLabs同时更新了音乐和语音生成模型,Music v2能从提示生成任何风格音乐,Seed Audio 1.0支持图片转语音,玩法更多了。
阿里刚发的Qwen-Audio-3.0-Realtime,实时语音四项升级,又快又聪明,做语音交互项目的可以试试。
xAI把语音转文字、大模型、文字转语音三个环节整合到一个接口里,延迟更低、故障更少,用Grok Voice搞语音交互的可以试试。
Karan Goel 发了两个新模型,Sonic-3.5 做 TTS 排名第一,Ink-2 做 STT 也是第一,说是唯一一家听说都做到顶的。做语音智能体的话看看。
微软的多模态模型终于能在 OpenRouter 上直接调用了,做图像生成、语音转文字或语音合成的开发者可以省去 Azure 申请流程,直接上手试。
微软终于拿出了自己的推理模型,而且强调纯自研、不蒸馏,这对关注模型自主可控的开发者是个信号。做软件工程或编程的团队可以关注 MAI-Code-1 在 Copilot 中的实际表现,值得一试。
API 价格直降 99% 对开发者是实打实的成本利好,做 AI 应用集成或语音合成的团队可以直接切换,省下预算做更多实验。
教育场景的开发者终于有了可商用的开源多模态模型——27B 参数在数理问题上达到 SOTA,且推理成本更低;TTS 模型 3 秒克隆音色并跨语种带情感,做语音助手或教育产品的团队可以直接下载试试。
跨国会议和远程协作的团队终于有了低延迟、高拟真的同传方案——不用外挂设备,还能模仿发言人音色,做国际业务或跨语言沟通的可以直接在腾讯会议里开启试试。
做语音助手或客服机器人的开发者,现在可以用一条提示词把聊天智能体变成语音智能体,省去集成多个模型的麻烦,值得直接上手试。