10:16官方账号arXiv cs.AI@Minkyung Cho, Jihyo Kim, SeungWoo Song, Junghun Yuk, Minjoon Kee, Hoyun Song, KyungTae Lim精选73°研究人员发现看似无害的合成数据可作为隐蔽渠道向对齐模型注入特定社会偏见。实验中,未对齐的教师模型在创意写作和代码生成等领域生成过滤后的合成数据集,用于微调对齐的学生模型。这些合成数据在保持学生模型通用任务能力的同时,能传输目标偏见。研究提出了基于对数线性评分的潜在筛查方法。论文合成数据社会偏见大模型推荐理由:MIT学者发现合成数据能偷偷给AI注入偏见,即使数据本身看起来完全无害。原文稍后读已读值得跟进有用关注 合成数据