#奖励函数
共 3 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「奖励函数」标签的资讯、产品与论文,按刊登时间排,新的在上。
8月13日
6月18日
6月2日
DrPO:一步生成模型偏好优化的新方法
DrPO 解决了单步生成模型偏好微调的核心痛点——无需可微奖励或复杂去噪轨迹,做文本到图像生成的团队可以直接用黑箱奖励提升模型对齐度,训练效率还提升了3倍多,值得关注。
DrPO 解决了单步生成模型偏好微调的核心痛点——无需可微奖励或复杂去噪轨迹,做文本到图像生成的团队可以直接用黑箱奖励提升模型对齐度,训练效率还提升了3倍多,值得关注。