孟加拉语这种低资源语言上,Llama 4 Maverick 不微调就拿下 0.931 的 F1,比 BanglaBERT+XGBoost 还高,做低资源语言分类的可以看看。
#低资源语言
共 19 条 · 7 天 1 条 · 30 天 4 条
信息流里打上「低资源语言」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月6日
研究用 Bengali 数据集测高校立场极化,Llama 4 Maverick 零样本 F1 达 0.931
9月28日
VoiceArena 发布 Monsoon:50 语言语音数据集让 Telugu 语音识别错误率从 92.7% 降到 16.1%
同一个 Whisper Medium,换个数据集微调就把 Telugu 错误率从 92.7% 干到 16.1%,还故意保留噪声做分层,思路很值得学。
9月25日
面向加纳三语青少年健康语音识别的基准测试与领域适配研究
加纳团队用 Qwen3-ASR-0.6B 给三种本地语言做语音识别,Ewe 错误率砍掉近一半,还上线了健康问答应用 KasaHealth,低资源语言落地的完整参考。
8月31日
8月19日
8月13日
8月7日
7月23日
7月21日
7月3日
论文09:57
LLM-as-a-Judge在多语言和低资源语言中的挑战与建议这篇论文很实在,直接指出LLM-as-a-Judge在多语言场景下不靠谱,只找出33篇相关研究还一堆问题。做NLP评估的朋友建议看看。
6月12日
论文10:28
SkMTEB:斯洛伐克语首个MTEB文本嵌入基准与模型适配低资源语言NLP开发者终于有了可本地部署的高效嵌入方案——e5-sk系列在体积缩减62%后仍能匹敌商业API,做斯洛伐克语语义搜索或RAG的团队可以直接用开源模型替代付费服务。
6月3日
论文10:25
用从未发生的对话训练ASR:合成对话提升低资源语言识别低资源语言ASR团队终于有了可落地的数据增强方案——用LLM+TTS生成对话数据,效果堪比数倍真实数据。做多说话人语音识别的开发者值得一试,尤其适合匈牙利语等小语种场景。
BaltiVoice:为巴尔蒂语构建的语音语料库与微调Whisper ASR系统
这是首个为巴尔蒂语打造的ASR系统,解决了低资源语言语音识别的空白,做多语言语音技术或濒危语言保护的团队可以直接用这个开源模型和语料库。
5月22日
5月19日
5月14日
WARDEN:仅用6小时训练数据实现濒危原住民语言转录与翻译
低资源语言处理是 NLP 的硬骨头,WARDEN 用两阶段设计+跨语言迁移+词典增强给出了可行方案,做低资源 ASR/NMT 的研究者可以直接参考其技术路线。
DocAtlas:覆盖82种语言的多语言文档理解框架
做多语言文档理解或 OCR 的团队终于有了一个覆盖 82 种语言的高质量基准和训练框架,低资源语言场景可以直接用 DPO 方法提升效果,建议点开看具体实现。