10:48官方账号arXiv cs.LG@Boryeong Cho, Sumyeong Ahn, Se-Young Yun精选73°PLC-DPO方法通过将每对训练信号路由为清洁、翻转或平局情况,优化偏好学习。该方法在57个数据集-模型-基准测试单元中,平均胜率达60.5%,超过DPO方法的55.5%。注入噪声测试和人类分歧分析表明,该方法能稳定区分翻转与弱方向性偏好对。论文PLC-DPODPO偏好优化推荐理由:研究人员提出PLC-DPO,能校正噪声偏好数据,在57个测试单元中胜率超DPO 5个百分点。原文稍后读已读值得跟进有用关注 PLC-DPO