论文11:53RoMeRL:通过降阶效用状态平衡自进化智能体记忆中的反馈覆盖与记忆-奖励陷阱这论文把智能体记忆里反馈分散和奖励污染的问题一起解决了,Cold-Q降了80%,记忆体积缩了84%,效果很硬核。#RoMeRL#智能体#记忆系统#ALFWorldaarXiv cs.LG@Yi Yang 等 8 人原文稍后读已读值得跟进有用关注 RoMeRL