论文10:41LenGuard-GPC:用引导提示一致性控制长度,提升空间推理强化学习这篇论文用KL散度做密集奖励,还加了长度控制,空间推理上比GRPO更准更短,值得搞强化学习的人看看。#LenGuard-GPC#GRPO#空间推理#强化学习aarXiv cs.AI@Xingjian Tao 等 4 人原文稍后读已读值得跟进有用关注 LenGuard-GPC