16:59官方一手arXiv: OpenAI@Ireddi Rakshitha, Devavarapu Yashwanth, Ntakirutimana PierreKinyaEmbed是首个专为基尼亚万达语设计的句子嵌入模型,该语言在卢旺达有1200万使用者。模型基于KinyaBERT-large,通过四阶段课程训练:第一阶段使用约18,000对同义句,第二阶段在715个NLLB翻译的三元组上微调,第三阶段使用英-基尼亚万达语翻译对对齐表示,第四阶段用2,936对高质量数据 refine。在SemRel2024-rw基准上,七检查点集成模型得分达0.7298,超越mE5-large 20.9%和OpenAI text-embedding-3-large 41.0%。AI模型KinyaEmbedKinyaBERT-large基尼亚万达语10 个信源在谈事件专题推荐理由:卢旺达团队发布了首个基尼亚万达语专用嵌入模型,四阶段训练效果显著,开源了模型和数据集。原文稍后读已读值得跟进有用关注 KinyaEmbed