AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

OR

共 1 条相关 AI 资讯
7月21日
11:55
11:55官方账号arXiv cs.LG@Chinmay Rane, Kanishka Tyagi, Michael Manry
本文提出Output Reset(OR)作为PPO和GRPO中裁剪替代目标的平滑替代方案,使用OR平方边际损失在token对数比率空间进行优化。在Llama-3.2-1B-Instruct模型上基于Anthropic hh-rlhf数据集测试,PPO-OR在广义优势估计下最终奖励模型得分比PPO-clip平均高0.305,但seed间方差更大。GRPO-OR在组相对优势下平均得分未提升,但方差更小且过冲分数下降。两种组相对方法均比GAE方法产生更大的rollout到当前对数比率位移,OR未能一致减少此位移。报告分数为训练时奖励模型测量值,非独立人类偏好表现。
论文ORPPOGRPO
事件专题

推荐理由:这篇论文用OR替换PPO和GRPO的裁剪目标,在Llama-3.2上奖励得分有提升,适合想了解强化学习微调新思路的同学
原文
精选全部日报登录