11:55官方账号arXiv cs.LG@Chinmay Rane, Kanishka Tyagi, Michael Manry本文提出Output Reset(OR)作为PPO和GRPO中裁剪替代目标的平滑替代方案,使用OR平方边际损失在token对数比率空间进行优化。在Llama-3.2-1B-Instruct模型上基于Anthropic hh-rlhf数据集测试,PPO-OR在广义优势估计下最终奖励模型得分比PPO-clip平均高0.305,但seed间方差更大。GRPO-OR在组相对优势下平均得分未提升,但方差更小且过冲分数下降。两种组相对方法均比GAE方法产生更大的rollout到当前对数比率位移,OR未能一致减少此位移。报告分数为训练时奖励模型测量值,非独立人类偏好表现。论文ORPPOGRPO1 个信源在谈事件专题推荐理由:这篇论文用OR替换PPO和GRPO的裁剪目标,在Llama-3.2上奖励得分有提升,适合想了解强化学习微调新思路的同学原文稍后读已读值得跟进有用关注 OR