18:14官方账号arXiv cs.AI@Zike Yuan, Han Zhang, Jianzhi Yan, Le Liu, Cai Ke, Huozhi Zhou, Jian Xie, Jiran Yin, Yukun Cao, Yue Yu, Hui Wang, Ming Liu, Bing Qin精选73°GRAIN是一种单智能体框架,通过强化学习优化,使用结构不变性奖励指导LLM学习鲁棒的文本到结构映射。该框架在GRIT基准测试上比多智能体基线准确率高16.45%,延迟降低约24%。GRAIN将SFT模型的OOD差距从15.77%缩小到7.80%,并在训练分布外的大规模图上保持鲁棒性。论文GRAIN图推理强化学习推荐理由:MIT团队推出GRAIN框架,用单智能体解决图推理中的标识符和任务表述变化问题,比多智能体方案更快更准。原文稍后读已读值得跟进有用关注 GRAIN