7月31日
11:55
11:55官方账号arXiv cs.AI@Rong Wu, Daocheng Fu, Licheng Wen, Xuemeng Yang, Shu Zou, Jianbiao Mei, Yuxin Wang, Hairong Zhang, Yu Yang, Tao Hu, Cong Zhang, Botian Shi, Pinlong Cai
MemHarness 框架在决策时用统一策略模型批判并重构检索到的经验,而不是像基线那样逐字回放。重构能力通过 GRPO 端到端训练自然涌现,无需额外监督。在 ALFWorld 和 WebShop 两个基准上,MemHarness 显著超过纯 RL 和静态记忆增强基线。分析表明,MemHarness 的重构目标可防止负迁移,并在 OOD 场景中保持鲁棒性。
推荐理由:MemHarness 让智能体把旧经验改写到当前场景再用,在 ALFWorld 和 WebShop 上比静态记忆基线强不少。