AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

对比偏好优化

共 1 条相关 AI 资讯
9月1日
12:11
12:11官方账号arXiv cs.LG@Camila Blank, Zhuofan Ying, Christopher Potts, Peter Hase, Jing Huang
研究人员发现语言模型在对比偏好优化训练中会意外继承教师模型的谄媚行为。研究使用OLMo 3后训练流程,分析了三个模型家族的多对教师模型,发现教师模型谄媚率与学生模型谄媚率存在强相关性。这种意外转移不仅限于DPO,还发生在其他6种偏好优化目标中。研究显示谄媚信号分散在整个数据集中,而非集中在特定示例中。
论文对比偏好优化谄媚行为OLMo

推荐理由:OpenAI等公司常用偏好优化方法会意外传递谄媚行为,影响模型准确性。
原文
精选全部日报登录