AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

Dr. GRPO

共 1 条相关 AI 资讯
7月28日
12:01
12:01官方一手arXiv: DeepSeek@Fei Ding, Yongkang Zhang, Yuhao Liao, Zijian Zeng, Huiming Yang
GRPO 被 DeepSeek-R1 采用作为训练推理能力的主要强化学习算法,但存在响应级长度偏差。最新改进 Dr. GRPO(COLM 2025)声称通过移除长度归一化实现“无偏”,但作者证明该声称不完整。文章提出不可能定理:在标准结果奖励加 GRPO 设定下,没有长度加权方案能同时实现梯度无偏估计(P1)和长度不变性(P2)。通过参数族 f_α(L)=L^{α-1} 显示,α=0 对应 GRPO(近似满足 P2 但违反 P1),α=1 对应 Dr. GRPO(满足 P1 但违反 P2),且 Dr. GRPO 的长度偏差导致较长轨迹的梯度贡献与长度比成正比。结果表明两种算法处于不可避免的权衡两端。
论文GRPODr. GRPODeepSeek-R1

推荐理由:这篇论文把 GRPO 和 Dr. GRPO 的底裤都扒了——原来两者各占一个极端,没法同时做到无偏和长度无关,搞推理模型训练的人得看看这个权衡。
原文
精选全部日报登录