Monsoon 是个 10 万小时的多语言语音数据集,微调 Whisper 后孟加拉语词错率从 85% 降到 7.65%,做语音方向的可以试试 API 测测效果。
#Whisper
微调 Whisper Medium 就把孟加拉语 WER 从 85% 打到 7.65%,80 多家机构一周内排队要授权,低资源语音方向的值得关注。
小模型靠数据逆袭的实测案例:Whisper Medium 微调后孟加拉语错字率从 85% 掉到 7.65%,做低资源语言 ASR 的可以参考。
一篇很实在的参赛报告:LoRA 微调 Whisper 搞定阿拉伯语多方言和码切换识别,还公开了八个没做成的方向,做 ASR 的可以看看。
同一个 Whisper Medium,换个数据集微调就把 Telugu 错误率从 92.7% 干到 16.1%,还故意保留噪声做分层,思路很值得学。
vikingmute 分享的 skills,让 Agent 自动看视频,yt-dlp 下载、Whisper 转录、ffmpeg 抽帧,处理长录屏省事。
OpenAI 发的 GPT-Transcribe 在音频转录上比 Whisper 错误率低一半,多语言场景提升明显。
OpenMOSS 开源了一个 0.9B 参数的端到端模型,能一次搞定 90 分钟多人音频,告诉你谁说了什么、什么时候说的,单卡 4090 跑得飞快。
宝玉分享了用 Qwen3 ASR 替代 Whisper 做字幕的心得,时间戳对得很准,还配了发言人识别方案,适合搞视频翻译的朋友。
这个研究用DiffusionGemma做语音识别,并行解码8步就达到6.6%错误率,只训练了0.16%的参数,挺高效的。
MacWhisper 14 新增编辑器视图,能直接改转录稿,CPU占用也降了,转录更顺滑,推荐播客制作者升级。
Cohere搞了个阿拉伯语语音模型,20亿参数,专门对付方言和双语,据说比Whisper还牛,搞语音识别的快试试。
做呼吸疾病音频诊断或短音频分类的团队,可以直接借鉴CoughSense的主动帧池化和域自适应方案,解决Whisper在短信号上的静音稀释痛点。
匈牙利语 ASR 研究者终于有了更大规模的对话数据集——BEA-Dialogue+ 将可用训练数据从85小时扩展到200小时,做低资源语言语音识别的团队可以直接用于模型评估和微调。