grpo·concept

GRPO

别名
首次出现
2026-05-22
最近出现
2026-07-29
累计提及
147
§ 01综述

GRPO(Group Relative Policy Optimization)是一种强化学习算法,通过分组相对优势估计来优化语言模型策略,特别适用于奖励信号可验证的推理任务。它由DeepSeek提出,在数学推理、代码生成等场景中展现出高效性,近期围绕其稳定性、可扩展性及多模型协同出现了多项改进工作。

GRPO 近期进展

  • 协同推理框架 Tandem RL:提出一种多模型协同推理方法,在RLVR(基于可验证奖励的强化学习)中让不同规模的模型协同优化,可能扩展GRPO的应用模式。Tandem Reinforcement Learning 在 RLVR 中实现模型协同推理
  • BashCoder-R1:基于GRPO策略的Bash代码生成框架,通过可验证奖励提升代码的鲁棒性与可解释性,体现了GRPO在结构化任务中的效果。BashCoder-R1:面向鲁棒可解释Bash代码生成的框架
  • Fireworks 推出 Nemotron 3 RL 微调服务:该服务支持按GPU小时计费的RL微调,可能包括GRPO算法,标志着GRPO从研究走向商业化应用。Fireworks 推出 Nemotron 3 RL 微调服务,按 GPU 小时计费
  • STARE:惊讶度引导的GRPO稳定性改进:提出基于令牌级优势重加权的STARE方法,通过惊讶度引导策略熵正则化,缓解GRPO在训练中的不稳定问题。STARE: 基于惊讶度引导的令牌级优势重加权策略熵稳定性方法
  • 当前焦点与观察点

    当前GRPO研究主要围绕三个方面:一是奖励信号的设计与可移植性,例如通过可移植查询生成实现工业语义搜索;二是算法稳定性,如STARE通过优势重加权缓解策略熵崩塌;三是多模型协同扩展,Tandem RL展现了在异构模型间共享奖励信号的潜力。此外,GRPO在自动化技能生成(如SKILL.md)和视觉推理(如SPOT-E)中也有应用。争议点在于奖励过拟合与泛化能力之间的平衡,以及如何设计更鲁棒的组内优势估计。整体而言,GRPO正从单一优化方法演变为可组合的训练范式,未来可能进一步融合推理时搜索与并行聚合技术。

    § 02相关报道10 条在档
    1. 01
      强化学习用于代码优化:三阶段方法提升执行速度奖励信号
      arXiv cs.LG
    2. 02
      LLM框架用于多仓库库存分配的运营研究公式选择
      arXiv cs.AI
    3. 03
      多轮长程规划训练:从预训练到后训练的单/多教师在线策略蒸馏
      arXiv cs.LG
    4. 04
      GRPO与Dr. GRPO的无偏性与长度不变性不可能定理
      arXiv: DeepSeek
    5. 05
      Miles 引入 OPD:使 Qwen3.5-35B 推理缩短 3 倍且精度提升
      LMSYS Org (SGLang)
    6. 06
      全曲生成:层次化自回归规划与流匹配渲染
      arXiv cs.AI
    7. 07
      Off-Context GRPO:利用特权信息提升困难问题推理能力
      arXiv cs.LG
    8. 08
      精读 MiniMind 源码,从具体实现搞懂大模型技术体系
      Geek
    9. 09
      OR:一种可微分的信任域策略优化方法
      arXiv cs.LG
    10. 10
      LenGuard-GPC:用引导提示一致性控制长度,提升空间推理强化学习
      arXiv cs.AI
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/GRPO