论文12:04评估对话代理基准的基准框架这篇论文教你如何判断一个评测集靠不靠谱,用LLM当裁判自动挑毛病,省人工还靠谱。#基准评估#对话代理#LLM评判#自动化评估aarXiv cs.AI@Noam Koren 等 3 人原文稍后读已读值得跟进有用关注 基准评估
论文精选12:59RBI-Eval:衡量记忆增强对话代理何时不该使用敏感记忆该研究揭示了记忆增强AI代理在敏感信息使用上的关键盲区,做对话系统和个性化AI的开发者值得关注——它直接关系到用户隐私和信任。#记忆增强#对话代理#隐私安全#评估框架aarXiv: DeepSeek@Lingxiang Xu 等 5 人原文稍后读已读值得跟进有用关注 记忆增强