#语音识别
这篇论文提出了一个很酷的架构,叫Residual Full-Rate PR,它用AddUNet来学习任务导向的表示,在语音识别任务上效果不错。
这个研究很实用,它详细分析了不同AI模型在处理英语和约鲁巴语混合语音时的表现差异,特别是那些切换点错误率的数据,对做相关研究或评估模型的人很有参考价值。
PolyAI出了个新对话模型Dialog-RSN-1,直接听人说话不用转文字,还能自动接话和调函数,延迟不到300毫秒。
阿里把语音识别模型更新到 3.0,医疗等专业词识别更准了,错字率低到 1.7%,还开放了三个版本随便用。
OpenAI 出了新语音转文字模型,错误率比 ElevenLabs 高不少,自己测试可以,正经用还是优先选 ElevenLabs 吧。
OpenAI 这次发了两个转录模型,gpt-transcribe 在真实录音上词错误率只有 8.98%,比之前的 Whisper-1 好了一半,而且每分钟还便宜 25%,做语音转录的可以看看。
OpenAI 出了两款转录模型,GPT-Live-Transcribe 实时转录延迟低,GPT-Transcribe 批量处理更便宜,错误率比 Whisper 低一半多。
Grok STT 刚上线 OpenRouter,25 种语言语音转文字才 0.1 刀一小时,还有说话人分离,做音频处理很划算!
小米语音首席科学家拿了 ISCA Fellow,Kaldi 和 OmniVoice 都是他搞的,业内公认的语音大神。
阿里刚发的Qwen-Audio-3.0-Realtime,实时语音四项升级,又快又聪明,做语音交互项目的可以试试。
这个研究用DiffusionGemma做语音识别,并行解码8步就达到6.6%错误率,只训练了0.16%的参数,挺高效的。
Cohere搞了个阿拉伯语语音模型,20亿参数,专门对付方言和双语,据说比Whisper还牛,搞语音识别的快试试。
小米新出的语音模型 MiMo-V2.5-ASR 能听方言、混中英文、扛噪音,每小时才五毛钱,适合做语音转录的朋友试试。
阿里千问发了新语音模型,支持30种语言+16种方言,方言准确率干过火山腾讯,离线版字错率全球最低。
xAI把语音转文字、大模型、文字转语音三个环节整合到一个接口里,延迟更低、故障更少,用Grok Voice搞语音交互的可以试试。
Together AI 把 Parakeet 优化到每秒转写 302 秒音频,比别的服务快一大截,想搞语音识别的可以看看这篇系统调优拆解。
Karan Goel 发了两个新模型,Sonic-3.5 做 TTS 排名第一,Ink-2 做 STT 也是第一,说是唯一一家听说都做到顶的。做语音智能体的话看看。
做语音转录或实时字幕的开发者终于有了一个开源且低延迟的选择——Voxtral Realtime 的 Apache 2 许可和 sub-200ms 延迟值得一试。
语音转文字场景的开发者终于有了微软官方的强力选项——MAI-Transcribe-1.5 在精度和速度上双双突破,做会议转录、客服质检或多语言内容处理的团队可以直接在 Azure 上试用,省去自建模型的麻烦。