论文13:00GEAR:证据感知奖励减少长上下文推理重复复制这篇论文发现了LLM长上下文推理时爱复制原文的毛病,用GEAR奖励方法逼模型关注关键证据,效果立竿见影,适合做RL调优的参考。#GEAR#证据感知#强化学习#长上下文推理aarXiv cs.AI@Lizhe Fang 等 4 人原文稍后读已读值得跟进有用关注 GEAR