论文精选19:12FG-ExPO:自适应KL与高斯课程采样提升GRPO数学推理做LLM数学推理RL训练的团队,GRPO的KL系数和采样策略可以照搬这个改进,AIME 2025上13个点的提升值得一试。#GRPO#强化学习#数学推理#课程学习aarXiv: DeepSeek@Mingxiong Lin 等 9 人原文稍后读已读值得跟进有用关注 GRPO