#ASR
微调 Whisper Medium 就把孟加拉语 WER 从 85% 打到 7.65%,80 多家机构一周内排队要授权,低资源语音方向的值得关注。
一篇很实在的参赛报告:LoRA 微调 Whisper 搞定阿拉伯语多方言和码切换识别,还公开了八个没做成的方向,做 ASR 的可以看看。
SmallestAI 在 VoiceArena 语音榜单拿了第一,这个榜用远场真实录音测试、每人单独麦克风做标注,比传统干净音频基准靠谱多了。
这位开发者做了个开源神器,B 站、YouTube、播客视频点一下就出双语字幕,点句子直接跳转,还能存进 Obsidian,学外语看课程都好用。
向阳乔木的乔木剪藏插件更新了,TikTok、Ted、小宇宙都能一键转字幕,40 分钟视频 20 秒出稿,还能边看边问 AI,开源免费。
Apple 发了一篇联邦学习论文,讲怎么用伪标签在无标注数据上训 ASR 模型,还给了稳定训练的实操配方,做语音方向的可以看看。
阿里 Qwen 把语音识别、合成、实时对话打包成五个模型一起发,ASR 最高打 0.5 折,做播客或有声书的可以试试 TTS-Next。
这个研究很实用,它详细分析了不同AI模型在处理英语和约鲁巴语混合语音时的表现差异,特别是那些切换点错误率的数据,对做相关研究或评估模型的人很有参考价值。
OpenAI 发的 GPT-Transcribe 在音频转录上比 Whisper 错误率低一半,多语言场景提升明显。
宝玉分享了用 Qwen3 ASR 替代 Whisper 做字幕的心得,时间戳对得很准,还配了发言人识别方案,适合搞视频翻译的朋友。
小米新出的语音模型 MiMo-V2.5-ASR 能听方言、混中英文、扛噪音,每小时才五毛钱,适合做语音转录的朋友试试。
做语音助手或客服系统的团队会发现,当前ASR模型在双语用户面前漏洞百出——代码切换场景的错误率远高于单语言,这个基准测试直接暴露了痛点,建议点开看看你的模型能否过关。
匈牙利语 ASR 研究者终于有了更大规模的对话数据集——BEA-Dialogue+ 将可用训练数据从85小时扩展到200小时,做低资源语言语音识别的团队可以直接用于模型评估和微调。