#偏好对齐
共 10 条 · 7 天 0 条 · 30 天 2 条
信息流里打上「偏好对齐」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月29日
9月17日
8月13日
8月5日
论文12:03
扩散模型偏好对齐新方法 Latent Reward Registers这篇论文给扩散模型加了个奖励寄存器,不用改生成器就能获得稠密奖励,训练比在线 RL 快 33 倍,做生成对齐的可以看看。
7月21日
7月9日
6月29日
6月16日
论文12:14
TuneJury:用于改善音乐生成偏好对齐的开放度量如果你在搞音乐生成,想用人类偏好来对齐模型,这个开源的奖励模型 TuneJury 可以让你直接拿来用,还附带了三种应用示例,比重新训一个省事多了。
5月20日
5月19日
PPR-GDE:面向开放生成的对偶偏好奖励与群体多样性增强方法
做开放域文本生成(如角色扮演、创意写作)的团队,终于有了一个兼顾对齐质量和输出多样性的RL方法,不用再担心模型输出千篇一律,值得点开看实现细节。