10:41官方账号arXiv cs.AI@Xingjian Tao, Yiwei Wang, Yujun Cai, Jing TangLenGuard-GPC是一种密集奖励框架,针对多视图空间推理中标准GRPO奖励稀疏且无法控制推理长度的问题。它通过比较标准提示与引导提示下token级预测分布的KL散度,提供密集奖励信号。同时引入分阶段长度奖励,将推理长度控制在合理范围,避免简单鼓励短回答。在6项多视图空间推理基准上,LenGuard-GPC相比原始GRPO提升了准确率,同时降低了平均响应长度。论文LenGuard-GPCGRPO空间推理推荐理由:这篇论文用KL散度做密集奖励,还加了长度控制,空间推理上比GRPO更准更短,值得搞强化学习的人看看。原文稍后读已读值得跟进有用关注 LenGuard-GPC