#语音识别
Monsoon 是个 10 万小时的多语言语音数据集,微调 Whisper 后孟加拉语词错率从 85% 降到 7.65%,做语音方向的可以试试 API 测测效果。
小模型靠数据逆袭的实测案例:Whisper Medium 微调后孟加拉语错字率从 85% 掉到 7.65%,做低资源语言 ASR 的可以参考。
马来西亚加油 App Setel 出了个语音加油功能,对着手机说油枪号就能开泵,还支持中文,在 Petronas 加油可以试试。
SmallestAI 在 VoiceArena 语音榜单拿了第一,这个榜用远场真实录音测试、每人单独麦克风做标注,比传统干净音频基准靠谱多了。
同一个 Whisper Medium,换个数据集微调就把 Telugu 错误率从 92.7% 干到 16.1%,还故意保留噪声做分层,思路很值得学。
一个 San Francisco 创业者因为爷爷被假语音骗了,做了个能装进手机、打电话时实时识别 deepfake 的小模型,正在 Disrupt 参赛。
一家叫 Modulate 的公司拿了 2500 万美元融资,专做语音检测,能识别 deepfake 假声音和电话诈骗,做风控的可以看看。
这篇不聊概念,讲一个真实上线的阿拉伯语语音产品怎么搭:6 个 MCP 服务器做检索、自训的 6B 路由模型和 TTS 都开源了,做语音 Agent 的能抄不少作业。
Edge0开源的流式语音识别模型,中英文都能转,延迟几百毫秒,显存占用恒定不爆内存,直播听写可以直接跑起来。
humynlabs 出了个语音识别新基准,专测真实对话和混语言场景,23 个模型已上榜,做语音方向的可以拿来自测。
研究者做了个 3879 条语音声明的核查基准,发现 LALM 听到语音就变笨,加上推理才能到 86.1%,做语音事实核查的可以看看。
加纳团队用 Qwen3-ASR-0.6B 给三种本地语言做语音识别,Ewe 错误率砍掉近一半,还上线了健康问答应用 KasaHealth,低资源语言落地的完整参考。
Apple 发了一篇联邦学习论文,讲怎么用伪标签在无标注数据上训 ASR 模型,还给了稳定训练的实操配方,做语音方向的可以看看。
AWS 出了个现成的 WhisperX 容器,一键部署到 SageMaker 就能拿到带说话人标注的逐词转写,还讲了扩缩和省钱细节。
VoiceArena 搞了个 diarization 评测榜,12 款系统同题同规则比拼,还能看时间容差一变分数差多大,做语音的可以去看看。
英伟达新出的说话人日志模型,100M 能本地跑,专门负责“谁在何时说话”,配 ASR 就能做分角色转写,比 Qwen 那个更专精。
一个叫 Audio8 ASR Infinite 的流式语音识别开源了,能 7x24 无限时长转写不漂移,靠语义轮次检测解决长音频老毛病,做实时转写可以看看。
NVIDIA 开源了个说话人追踪模型,1秒语音就能分清谁在说话,还能让 Reachy Mini 机器人认人记名字,商用许可也友好。
NVIDIA 的说话人分离模型拿了 Diarization-Bench 第一,错误率 14.72%,比第二名低了近四分之一,做语音相关应用的可以关注下。
NVIDIA 出了个 100M 参数的小模型,专门搞定多人说话分不清谁是谁的问题,8 人以内、说话重叠都能识别,已经上了 Hugging Face。
NVIDIA 放出了一个教程,教你用 Nemotron 3 做说话人分离,会议转写能分清谁说了哪句,想做语音应用可以照着搭一遍。
Qwen 一次发了五款语音模型,能识别方言、区分多个说话人还能标注情绪,价格还砍了 95%,做语音应用的可以看看。
科大讯飞发了 Spark-ASR-2.0,方言和嘈杂环境识别提升明显,成本只涨 10%,明天就能在讯飞输入法里用上。
阿里这次一口气发了五款语音模型,方言识别和能自己生成配乐音效的 TTS-Next 都挺有意思,价格还砍了一波。
AssemblyAI 的 Universal-3.5 Pro 在 OpenRouter 上线了,19 种语言转文字还能加词级时间戳,9 月 29 日前半价,搞语音的可以去试试。
SpaceXAI 推出了 Grok Voice API 的 Transcribe 2.0,批处理每小时的费用是 0.10 美元,流式是 0.20 美元,可以试试。