AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

证据感知

共 1 条相关 AI 资讯
7月22日
13:00
13:00官方账号arXiv cs.AI@Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang
研究指出长上下文LLM存在重复复制问题,即模型将输入文本大量复制到推理轨迹中。通过将提示划分为关键证据和干扰上下文,发现根本原因是模型未充分关注关键证据。提出GEAR(Grounding Evidence-Aware Reward)奖励塑造方法,包含关键证据重叠奖励和干扰惩罚。在多个模型规模和基准测试中,GEAR相比基于准确率的强化学习平均提升最高+4.6点,且在更长上下文中效果更大。结果表明准确接地于相关证据是长上下文推理中不可或缺的能力。
论文GEAR证据感知强化学习

推荐理由:这篇论文发现了LLM长上下文推理时爱复制原文的毛病,用GEAR奖励方法逼模型关注关键证据,效果立竿见影,适合做RL调优的参考。
原文
精选全部日报登录