8月11日
11:24
11:24官方账号arXiv cs.AI@Pinzhen Chen, Koel Dutta Chowdhury, Xiaoya Xu, David Tan, Doreen Osmelak, Ona de Gibert, Ariun-Erdene Tumurchuluun, Ashok Urlana, Fedor Sizov, Hale Sirin, Jesujoba Alabi, Karrar Talib Abed, Mateusz Klimaszewski, Nikolay Bogoychev, Niyati Bafna, Patricia Schmidtova, Preksha Manjunath Shanbhag, Sherrie Shen, Vilem Zouhar, Vivek Iyer, Yasser Hamidullah, Yusser Al Ghussin, Zheng Zhao
Cultivar 是一个基于 FLORES 的本地化翻译基准,用于评估模型在特定地区文化语境下的翻译能力。该基准通过源语言对比设计,将未本地化版本与本地化版本配对,以检测数据污染和本地化鲁棒性。研究对 32 个开源权重模型进行测试,发现机器翻译专用模型鲁棒性较差,部分模型可能过拟合 FLORES,且模型普遍更擅长翻译美国内容而非其他地区内容。
推荐理由:想测翻译模型有没有背答案?Cultivar 用本地化对照来抓数据污染,32 个开源模型跑下来,发现 MT 专用模型反而更脆,美国内容翻译得最好。