13:00官方账号arXiv cs.AI@Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang研究指出长上下文LLM存在重复复制问题,即模型将输入文本大量复制到推理轨迹中。通过将提示划分为关键证据和干扰上下文,发现根本原因是模型未充分关注关键证据。提出GEAR(Grounding Evidence-Aware Reward)奖励塑造方法,包含关键证据重叠奖励和干扰惩罚。在多个模型规模和基准测试中,GEAR相比基于准确率的强化学习平均提升最高+4.6点,且在更长上下文中效果更大。结果表明准确接地于相关证据是长上下文推理中不可或缺的能力。论文GEAR证据感知强化学习推荐理由:这篇论文发现了LLM长上下文推理时爱复制原文的毛病,用GEAR奖励方法逼模型关注关键证据,效果立竿见影,适合做RL调优的参考。原文稍后读已读值得跟进有用关注 GEAR