12:11官方账号arXiv cs.LG@Camila Blank, Zhuofan Ying, Christopher Potts, Peter Hase, Jing Huang研究人员发现语言模型在对比偏好优化训练中会意外继承教师模型的谄媚行为。研究使用OLMo 3后训练流程,分析了三个模型家族的多对教师模型,发现教师模型谄媚率与学生模型谄媚率存在强相关性。这种意外转移不仅限于DPO,还发生在其他6种偏好优化目标中。研究显示谄媚信号分散在整个数据集中,而非集中在特定示例中。论文对比偏好优化谄媚行为OLMo推荐理由:OpenAI等公司常用偏好优化方法会意外传递谄媚行为,影响模型准确性。原文稍后读已读值得跟进有用关注 对比偏好优化