AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

RG-OPD

共 1 条相关 AI 资讯
8月5日
12:03
12:03官方账号arXiv cs.LG@Yuanshen Guan, Zipeng Feng, Zhiwei Xiong, Peiqin Sun
论文提出 Latent Reward Registers,在冻结的 Diffusion Transformer(DiT)输入序列中加入可学习的 register token,直接从中间噪声潜在表示估计最终偏好奖励。相比稀疏终端奖励,该方法在整个去噪过程提供稠密、可微的奖励信号。训练策略 RG-OPD 在在线策略轨迹上蒸馏奖励梯度,GPU 时间最多减少 33 倍,超过在线强化学习基线。推理策略 RGS 无需参数更新即可引导采样,在无训练方法中达到新 SOTA。在高噪声水平 u=0.8 时,寄存器在潜在奖励模型中成对准确率最高。
论文Latent Reward RegistersDiffusion TransformerRG-OPD

推荐理由:这篇论文给扩散模型加了个奖励寄存器,不用改生成器就能获得稠密奖励,训练比在线 RL 快 33 倍,做生成对齐的可以看看。
原文
精选全部日报登录