9月1日
10:48
10:48官方账号arXiv cs.LG@Boryeong Cho, Sumyeong Ahn, Se-Young Yun
精选73°
PLC-DPO方法通过将每对训练信号路由为清洁、翻转或平局情况,优化偏好学习。该方法在57个数据集-模型-基准测试单元中,平均胜率达60.5%,超过DPO方法的55.5%。注入噪声测试和人类分歧分析表明,该方法能稳定区分翻转与弱方向性偏好对。
推荐理由:研究人员提出PLC-DPO,能校正噪声偏好数据,在57个测试单元中胜率超DPO 5个百分点。