markdown
GRPO
concept · 首次出现 2026-05-22 · 最近出现 2026-09-13 · 累计提及 197
综述
相关报道
10 条在档- HuggingFace公开训练智能体系列视频及代码shao__meng
- 基因组工具选择的全组策略优化方法arXiv cs.AI
- ThinkPrior:零轮次难度先验用于RLVR冷启动提示选择arXiv cs.AI
- 韩国开放API基准与多步工具调用数据合成arXiv cs.AI
- DRACO:动态评分细粒度信用分配arXiv cs.LG
- Cliff:从首次错误中学习过程奖励arXiv cs.LG
- TASPO解决智能体政策优化中的监督-信用差距arXiv cs.AI
- DiffPDE:掩码扩散模型作为偏微分方程求解器arXiv cs.AI
- PAC:LLM多任务强化学习的新课程方法arXiv cs.LG
- 工具集成数学推理的强化学习研究arXiv cs.AI