11:11arXiv cs.AI@Guanming Liu, Yuqi Ren, Hansu Gu, Peng Zhang, Weihang Wang, Jiahao Liu, Ning Gu, Tun LuStreamMemBench是一个针对智能体记忆的流式评估基准,基于EgoLife自我中心流构建两步任务序列。初始任务测试证据使用,后续任务测试反馈与交互经验的复用。基准包含证据回忆、初始证据使用、反馈整合和后续复用四项指标。实验在8个记忆系统、2个基础模型上显示,当前系统在证据使用和反馈转化为可靠行为方面常失败。论文StreamMemBenchEgoLife智能体记忆评估基准测试推荐理由:测测你的智能体记性原文