9月1日
09:15
09:15官方账号arXiv cs.AI@Xinke Jiang, Yue Fang, Zhibang Yang, Jiaran Gao, Zhixin Zhang, Tao Feng, Rihong Qiu, Wentao Zhang, Hongxin Ding, Ruizhe Zhang, Yongxin Xu, Yuheng Huang, Xu Chu, Junfeng Zhao, Yasha Wang
精选73°
AgenticRag-R1 是一种新型强化学习框架,通过内存栈和细粒度动作空间深度整合推理、检索和记忆功能。该模型在多跳、开放域和智能体推理基准测试中表现优于强基线模型,支持多种骨干模型规模。研究团队引入了分层动作感知奖励机制和信息感知轨迹拒绝策略,实现有效的长时程学习。
推荐理由:清华团队推出 AgenticRag-R1,解决多步推理中的检索适应性问题,比传统方法更聪明。