论文12:30RRC:基于排序的奖励构建,解锁生成式奖励模型在强化学习中的应用这篇论文提出 RRC,能把生成式奖励模型的排序结果转成强化学习能用的信号,在对话和推理任务上比现有方法更稳定地提升训练效果。#RRC#生成式奖励模型#强化学习#奖励建模aarXiv cs.LG@Chenglong Wang 等 12 人原文稍后读已读值得跟进有用关注 RRC