11:42官方一手arXiv: OpenAI@Ayoub Kirouane, Christos Petrocheilos研究对三个前沿专家混合模型(阿里巴巴、OpenAI、NVIDIA,3.6-4.0B参数)进行微调,使其在低资源语言中推理。准确率基准显示几乎无变化,基准本身存在噪声(随机种子变动导致分数变化7.7点)。基础模型从不使用希腊语思考(0/1000推理轨迹),而SFT后98%的推理使用问题语言,且四个模型的语法判断均有提升。SFT无法修复自身缺陷,但强化学习可显著改善格式跳过和答案泄漏问题。论文SFTRL低资源语言10 个信源在谈事件专题推荐理由:论文揭示SFT和RL如何让模型真正用低资源语言思考,而非表面准确率提升,还发布了五个实用检查点。原文稍后读已读值得跟进有用关注 SFT
17:43官方账号arXiv cs.AI@Avijit Roy, Proma Roy论文以孟加拉语为例,分析AI教育工具在低连接环境中的结构性障碍。孟加拉语占全球人口近4%,但全球网页内容占比不足0.5%。主要多语语料库中,英语与孟加拉语的训练token比例达67:1。孟加拉语的元音附标文字还带来额外的token化惩罚,加剧数据短缺。农村地区个人互联网普及率为36.5%,城市为71.4%,形成连接排斥。论文孟加拉语低资源语言tokenization推荐理由:这篇论文讲孟加拉语在AI基建里的吃亏,67:1的token差距和36.5%的农村联网率是硬数据。原文稍后读已读值得跟进有用关注 孟加拉语
09:35官方账号arXiv cs.LG@Hoda Fakharzadehjahromy, Emil Wiman, Andreas Bueff, Hafsteinn Einarsson, Fredrik HeintzSAGA是一个用依赖解析器替代人工偏好标注的偏好优化框架,面向形态丰富但标注稀缺的低资源语言。它把解析器判断转换为delta-DPO偏好对,并用解析质量与词汇多样性的复合奖励进行优化。在丹麦语、冰岛语和挪威博克马尔语上基于GPT-SW3-1.3B测试,丹麦语解析成功率从69.0%升至93.8%,冰岛语独立评测提升4.5个百分点,挪威博克马尔语提升28个百分点。结果表明,在高质量解析器可用的低资源语言中,解析器监督可成为人工偏好标注的实用替代方案。论文SAGAGPT-SW3低资源语言推荐理由:这篇论文用依赖解析器代替人工标注做偏好优化,北欧三种低资源语言上效果提升明显,做多语言模型的人可以看看。原文稍后读已读值得跟进有用关注 SAGA
11:49官方账号arXiv cs.AI@Pouria Mahdi, Haq Nawaz Malik波斯语虽然被超过1.1亿人使用,但其OCR技术远落后于拉丁语系语言,原因是文字复杂且缺乏大规模标注数据。Persian Pixel数据集包含343,000多张高保真图像-文本对,来自精心筛选的700万波斯词语料库。生成管道SynthOCR-Gen模拟了波斯文字连写、字形变体、变音符号等特征,并加入25种以上随机退化模型(如墨迹扩散、纸张老化、模糊等)。该数据集可用于训练TrOCR、Donut等基于Transformer的OCR模型,为低资源复杂文字OCR提供可扩展的合成数据方案。论文Persian PixelOCR波斯语推荐理由:做波斯语OCR不用愁数据了,Persian Pixel有34万张合成图加上25种真实退化模拟,直接拿它训模型比手动标注省事得多。原文稍后读已读值得跟进有用关注 Persian Pixel
09:49官方账号arXiv cs.LG@Ganapati Das, Dwipen Laskar, Hasin Afzal Ahmed, Sanjib Kr Kalita, Kshirod Sarmah, Hem Chandra Das, Manjula Kalita该论文提出基于Whisper模型的阿萨姆语ASR系统,在Mozilla Common Voice 24.0-Assamese语料库上微调,采用混合精度训练和梯度累积优化资源受限环境。微调后词错误率(WER)降至43.17%,字符错误率(CER)13.18%,与零样本基线相比分别相对提升78.26%和93.10%。语义评估BLEU得分为30.81,METEOR为0.5262,幻觉率降低96.70%,实时因子(RTF)改善32.38%。论文WhisperAssameseASR推荐理由:这篇论文告诉你如何微调Whisper搞定低资源语言阿萨姆语的语音识别,效果比零样本好一大截,WER直接降了78%原文稍后读已读值得跟进有用关注 Whisper
09:57官方账号arXiv cs.AI@A. Seza Doğruöz, Xixian Liao, Verena Blaschke, Jakob Prange, Senyu Li, David Ifeoluwa Adelani该论文分析了ACL Anthology中650篇提及LLM-as-a-Judge的论文,发现仅33篇关注低资源或多语言场景。研究发现存在不一致的评价结果、对LLM判断过度信任以及普遍依赖单一评判模型的问题。作者基于分析提出了针对多语言和低资源环境下使用LLM-as-a-Judge的具体建议。论文LLM-as-a-Judge低资源语言多语言推荐理由:这篇论文很实在,直接指出LLM-as-a-Judge在多语言场景下不靠谱,只找出33篇相关研究还一堆问题。做NLP评估的朋友建议看看。原文稍后读已读值得跟进有用关注 LLM-as-a-Judge
10:28官方账号arXiv cs.AI@Marek Šuppa, Andrej Ridzik, Daniel Hládek, Natália Kňažeková, Viktória Ondrejová研究团队发布了SkMTEB,这是斯洛伐克语首个全面的MTEB风格文本嵌入基准,包含31个数据集和7种任务类型,覆盖深度是现有多语言基准的近4倍。评估31个嵌入模型后发现,大型指令微调多语言模型表现最佳,而斯洛伐克语专用NLU模型在嵌入任务上迁移效果差。为满足高效本地部署需求,团队通过词汇修剪和微调Multilingual E5模型,开发了e5-sk-small(45M参数)和e5-sk-large(365M)模型,体积最多减少62%,性能却与商业API相当。所有基准、模型、数据集和代码均已开源,为其他低资源语言提供了可复现的路径。论文文本嵌入低资源语言斯洛伐克语推荐理由:低资源语言NLP开发者终于有了可本地部署的高效嵌入方案——e5-sk系列在体积缩减62%后仍能匹敌商业API,做斯洛伐克语语义搜索或RAG的团队可以直接用开源模型替代付费服务。原文稍后读已读值得跟进有用关注 文本嵌入
10:25官方账号arXiv cs.AI@Máté Gedeon, Péter Mihajlik低资源语言和垂直领域的对话式语音识别受限于多说话人训练数据稀缺。研究者提出一种数据增强流水线:先由LLM生成带参与者元数据的场景级对话,再将说话人属性映射到TTS语音配置,最后组装成说话人感知的合成对话。在匈牙利语BEA-Dialogue基准上,仅用67小时真实对话加636小时合成数据训练的模型,性能超过用2700小时真实语音训练的零样本模型。该方法适用于任何语言,且LLM生成器选择和合成数据组成对效果影响显著。论文语音识别数据增强低资源语言推荐理由:低资源语言ASR团队终于有了可落地的数据增强方案——用LLM+TTS生成对话数据,效果堪比数倍真实数据。做多说话人语音识别的开发者值得一试,尤其适合匈牙利语等小语种场景。原文稍后读已读值得跟进有用关注 语音识别
10:01官方一手arXiv: OpenAI@Muhammad Ali精选巴尔蒂语(Balti)是巴基斯坦吉尔吉特-巴尔蒂斯坦地区的一种藏语方言,此前没有任何公开的自动语音识别(ASR)资源。研究者构建了名为BaltiVoice的16.8小时朗读语音语料库,包含10060条经过验证的本地纳斯塔利克文字发音,数据源自Mozilla Common Voice录音。他们基于OpenAI Whisper-small模型进行微调,在538条验证集上实现了30.07%的词错误率(WER),而零样本基线高达182.18%。该语料库、微调模型及实时转录演示已公开发布在HuggingFace上,为低资源语言的语音技术发展提供了重要基础。论文语音识别低资源语言Whisper微调3 个信源在谈事件专题推荐理由:这是首个为巴尔蒂语打造的ASR系统,解决了低资源语言语音识别的空白,做多语言语音技术或濒危语言保护的团队可以直接用这个开源模型和语料库。原文稍后读已读值得跟进有用关注 语音识别
10:42官方一手arXiv: DeepSeek@Md. Asaduzzaman Shuvo, Mahedi Hasan, Md. Tashin Parvez, Azizul Haque Noman, Md. Shafayet Hossain Ovi精选多语言大模型在处理孟加拉语等低资源语言时,常因文化语境缺失导致敬语使用错误。研究者构建了BLADE数据集,包含4196个精心设计的对话对,用于指令微调。通过LoRA适配器对DeepSeek-8B和LLaMA-3.2-3B进行参数高效微调,模型在结构保真度和敬语对齐上显著提升。该工作为低资源多语言生成中的语用鸿沟提供了基准。代码和数据集已开源。论文多语言模型孟加拉语敬语对齐推荐理由:做低资源语言NLP或文化敏感对话系统的团队,这个数据集直接解决了敬语对齐的痛点,可以拿来微调自己的模型试试。原文稍后读已读值得跟进有用关注 多语言模型
14:03官方一手arXiv: DeepSeek@Dylan Marx, Marcel Dunaiski精选72°研究发现,使用低资源非洲语言(如南非荷兰语、斯瓦希里语、科萨语和祖鲁语)进行多轮对话,可以绕过ChatGPT、Claude、DeepSeek、Gemini和Grok等商业大模型的安全护栏。单轮翻译攻击无效,但多轮对话在英语上达到52.7%-83.6%的有害响应率,非洲语言也达到41.8%-78.2%。人工红队测试比自动化方法越狱率更高,且翻译质量是决定越狱成功的关键因素——翻译质量越差,越狱率越低。论文越狱攻击低资源语言多轮对话推荐理由:安全团队和LLM开发者需要警惕:多语言安全漏洞远未被堵住,低资源语言成为新的攻击面。建议立即检查自家模型的多轮对话安全机制。原文稍后读已读值得跟进有用关注 越狱攻击
13:36官方账号EleutherAI@AiEleuther精选EleutherAI 在推特上推荐了 linguist_cat 在 LREC 会议上的口头报告,该研究训练了超过1000个小模型,覆盖350种语言。研究发现,这些小型语言模型在许多语言上表现与比它们大两个数量级的多语言模型相当甚至更好。这一成果挑战了当前多语言模型“越大越好”的范式,为低资源语言处理提供了更高效、更经济的解决方案。对于关注非英语、非中文语言处理的 NLP 研究者来说,这是一项值得关注的重要进展。论文多语言模型低资源语言小模型推荐理由:这项研究打破了多语言模型必须靠大参数量才能取得好效果的固有认知,做低资源语言 NLP 的团队可以直接参考其方法,用更小的成本覆盖更多语言。原文稍后读已读值得跟进有用关注 多语言模型
13:27官方账号arXiv cs.AI@Ziheng Zhang, Yunzhong Hou, Naijing Liu, Liang Zheng精选WARDEN 是一个针对极度低资源场景设计的语言模型系统,能够将澳大利亚濒危原住民语言 Wardaman 转录并翻译成英语。由于仅有6小时标注音频数据,传统的大规模端到端方法不可行,因此 WARDEN 采用两阶段架构:先进行音素转录,再翻译成英文。研究提出了两项关键技术:从与 Wardaman 音素相似的 Sundanese 语初始化转录模型,以及利用专家标注的 Wardaman-英语词典增强大语言模型的翻译推理。实验表明,在极低数据条件下,两阶段设计优于统一模型,WARDEN 仅用6小时数据即超越更大规模的开源和商业模型。代码与数据已开源。论文低资源语言语音转录翻译推荐理由:低资源语言处理是 NLP 的硬骨头,WARDEN 用两阶段设计+跨语言迁移+词典增强给出了可行方案,做低资源 ASR/NMT 的研究者可以直接参考其技术路线。原文稍后读已读值得跟进有用关注 低资源语言
13:27官方一手arXiv: DeepSeek@Ahmed Heakl, Youssef Mohamed, Abdullah Sohail, Rania Elbadry, Ahmed Nassar, Peter W. J. Staar, Fahad Shahbaz Khan, Imran Razzak, Salman Khan精选DocAtlas 是一个多语言文档理解框架,覆盖 82 种语言和 9 项评估任务,解决了低资源语言因训练数据稀缺和标注偏差导致的性能瓶颈。它通过差分渲染原生 DOCX 文档和基于 LaTeX 的合成生成(针对从右到左书写系统)来构建高保真 OCR 数据集,无需学习模型即可生成统一 DocTag 格式的结构化标注。评估 16 个 SOTA 模型发现低资源语言仍存在显著差距。使用直接偏好优化(DPO)以渲染生成的真实数据作为正信号,实现了稳定的多语言适配,在域内和域外准确率分别提升 1.9% 和 1.8%,而监督微调导致域外性能下降高达 21%。最佳变体 DocAtlas-DeepSeek 比最强基线提升 1.7%。论文多语言文档理解OCR低资源语言推荐理由:做多语言文档理解或 OCR 的团队终于有了一个覆盖 82 种语言的高质量基准和训练框架,低资源语言场景可以直接用 DPO 方法提升效果,建议点开看具体实现。原文稍后读已读值得跟进有用关注 多语言文档理解