论文精选11:34PPR-GDE:面向开放生成的对偶偏好奖励与群体多样性增强方法做开放域文本生成(如角色扮演、创意写作)的团队,终于有了一个兼顾对齐质量和输出多样性的RL方法,不用再担心模型输出千篇一律,值得点开看实现细节。#强化学习#开放生成#偏好对齐#多样性增强aarXiv cs.AI@Guining Cao 等 6 人原文稍后读已读值得跟进有用关注 强化学习