论文12:03扩散模型偏好对齐新方法 Latent Reward Registers这篇论文给扩散模型加了个奖励寄存器,不用改生成器就能获得稠密奖励,训练比在线 RL 快 33 倍,做生成对齐的可以看看。#Latent Reward Registers#Diffusion Transformer#RG-OPD#扩散模型aarXiv cs.LG@Yuanshen Guan 等 4 人原文稍后读已读值得跟进有用关注 Latent Reward Registers