论文精选12:00DrPO:一步生成模型偏好优化的新方法DrPO 解决了单步生成模型偏好微调的核心痛点——无需可微奖励或复杂去噪轨迹,做文本到图像生成的团队可以直接用黑箱奖励提升模型对齐度,训练效率还提升了3倍多,值得关注。#一步生成模型#偏好优化#文本到图像#SD-TurboaarXiv cs.LG@Zhou Jiang 等 3 人原文稍后读已读值得跟进有用关注 一步生成模型