00:21官方一手marktechpost@Asif Razzaq精选78°Cartesia 发布了基于状态空间模型构建的流式 TTS 模型 Sonic-3.6。该模型在 Artificial Analysis 的 Provider Voice 榜单上以 1,283 Elo 排名第一。它还在 Controlled Voice 榜单上取得 1,123 Elo 的成绩,该基准将所有模型克隆到相同的 8 个参考音色上。Sonic-3.6 实现了低于 90ms 的首字音频生成时间。AI模型CartesiaSonic-3.6语音生成推荐理由:Cartesia 新出的 Sonic-3.6 语音模型延迟很低,还拿了两个第一。原文稍后读已读值得跟进有用关注 Cartesia
18:13量子位@梦晨阿里推出国内首个AI语音平台CosyVoice Studio。CosyVoice Studio将语义理解融入语音能力。借助CosyVoice Studio,用户可一站式完成听、说、创。AI产品CosyVoice Studio阿里语音生成推荐理由:阿里新出的CosyVoice Studio,把语义理解直接融进语音,听、说、创一站式,玩语音的可以试试。原文稍后读已读值得跟进有用关注 CosyVoice Studio
15:41IT之家(博客/媒体)阿里巴巴发布一站式 AI 语音生产力平台 CosyVoice Studio,基于自研语音模型 Qwen-Audio 构建。平台包含语音记录工具 CosyFlow、语音智能体 CosyAgent 和音频创作工具 CosyCreative。CosyFlow 支持语音转写并过滤口语填充词,可生成邮件、会议纪要等结构化文本。CosyAgent 可通过自然语言创建实时对话智能体,兼容 prompt 与 workflow 配置。CosyCreative 内置上千种音色并支持声音复刻,上传文档即可生成播客或有声书。AI产品CosyVoice StudioQwen-Audio阿里巴巴推荐理由:阿里的 CosyVoice Studio 一口气集齐了语音转写、智能体和音频创作,现在是限时免费,想试试语音工具链的可以下载用用。原文稍后读已读值得跟进有用关注 CosyVoice Studio
11:30官方账号arXiv cs.AI@Thomas Thebaud, Yuzhe Wang, Hao Zhang, Sathvik Manikantan Napa Ugandhar, Ashish Hallur, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-VelazquezSPEARBench基于Seamless Interaction语料库构建对话提示,评估多个当代语音到语音模型在响应延迟、中断、语音质量、ASR鲁棒性、语言与方言一致性、情感自然度、人际关系立场等8个维度上的表现。与人类对话相比,当前模型在延迟、重叠、方言保留、情感适应和立场动态方面仍有差距。基准包含原始人类回答作为参考条件。论文SPEARBench语音生成对话系统推荐理由:想测语音AI聊天有多自然?SPEARBench从8个维度对比人类,告诉你现有模型的短板具体在哪。原文稍后读已读值得跟进有用关注 SPEARBench
23:29Philipp Schmid@_philschmidGemini TTS 新增流式生成功能,设置 `stream: true` 即可实时接收音频块。开发者可构建语音助手、旁白工具和对话应用,用户无需等待完整音频即可开始播放。该功能适用于需要即时响应的场景。AI产品Gemini TTS语音生成流式音频推荐理由:Gemini TTS 现在能边生成边播放了,做语音对话应用体验更流畅,直接设 `stream: true` 就能用。原文稍后读已读值得跟进有用关注 Gemini TTS