LSC-DPO:动态控制学习信号的偏好优化新方法
训练偏好模型的老问题:DPO 训到后面梯度就没劲了。这篇把 sigmoid 因子当成可调信号来动态控制,三个基准上都比 DPO 强,搞对齐训练的可以看看实现思路。
训练偏好模型的老问题:DPO 训到后面梯度就没劲了。这篇把 sigmoid 因子当成可调信号来动态控制,三个基准上都比 DPO 强,搞对齐训练的可以看看实现思路。
Fireworks给DeepSeek V4 Flash加了全套微调,监督、偏好、RL都能用,专为编码场景设计,快去试试。
DrPO 解决了单步生成模型偏好微调的核心痛点——无需可微奖励或复杂去噪轨迹,做文本到图像生成的团队可以直接用黑箱奖励提升模型对齐度,训练效率还提升了3倍多,值得关注。
做文本到图像生成的团队终于有了更稳定的对齐方法——Linear-DPO 统一了扩散和流匹配,解决了 DPO 在生成任务中的目标不匹配问题,做图像生成微调的建议试试。
该研究从图论视角重新审视偏好对齐,解决了DPO在多响应数据上的局限性,对提升模型训练效率和稳定性具有实际指导意义。