论文Agent 与开发者09:31LSC-DPO:动态控制学习信号的偏好优化新方法训练偏好模型的老问题:DPO 训到后面梯度就没劲了。这篇把 sigmoid 因子当成可调信号来动态控制,三个基准上都比 DPO 强,搞对齐训练的可以看看实现思路。#DPO#LSC-DPO#偏好优化#对齐训练aarXiv: Anthropic@Yang Qu 等 4 人原文稍后读已读值得跟进有用关注 DPO