8月4日
11:53
11:53官方账号arXiv cs.LG@Yi Yang, Zhennan Chen, Yihong Zhuang, Tiehan Fan, Yinan Chen, Jian Li, Jian Yang, Ying Tai
RoMeRL将轨迹索引效用空间表示为按结果极性和记忆动态分解的固定维度任务记忆状态。在ALFWorld和LifelongAgentBench上,RoMeRL将Cold-Q比率降低80.0%,反馈密度提高约6.0倍。同时维护记忆大小减少84.4%,LLM调用减少21.1%。论文从理论上证明降阶参数化能增加每个效用坐标的平均反馈,代码已开源。
推荐理由:这论文把智能体记忆里反馈分散和奖励污染的问题一起解决了,Cold-Q降了80%,记忆体积缩了84%,效果很硬核。