12:06官方账号arXiv cs.LG@Peixuan Han, Runhui Wang, Ketan Ramaneti, Jie Hao, Gerald Friedland, Chris Kong精选73°Cliff是一种新的奖励塑造策略,利用现成LLM识别推理过程中的首次错误。该方法将推理分解为正确前缀和错误后缀两部分,并将此信号转换为令牌级优势。在12种不同场景的实验中,Cliff的推理性能表现优异,比在线蒸馏方法提升15%,比标准GRPO提升7%。即使使用能力适中的教师模型,Cliff也能有效提升RLVR的精细监督效果。论文CliffRLVR强化学习推荐理由:研究人员提出Cliff方法,通过识别首次错误来改进强化学习,性能提升显著且适用性广。原文稍后读已读值得跟进有用关注 Cliff