11:54官方一手arXiv: DeepSeek@Zheling Tan, Jin Gao, Dequan Wang精选CABLE是一种插件式内存增强方法,专为解决LLM代理长期记忆中的证据可达性问题。该方法在LoCoMo和MA-LongMemEval基准测试中使用Qwen3.5-27B、DeepSeek-chat和GPT-4o-mini进行评估。CABLE通过构建稀疏的推理相关关联,而非重复主机检索器已覆盖的内容,显著提升了跨记忆和会话的证据检索能力。在开放域、多会话和偏好导向问题类别中,CABLE实现了最大的性能提升。AI模型CABLE记忆检索LLM代理推荐理由:清华团队提出CABLE方法,让AI记忆系统不再只靠相似度,而是通过互补链接找回被遗忘的关键信息。原文稍后读已读值得跟进有用关注 CABLE
09:41官方账号arXiv cs.LG@Yicheng Feng, Yan Zhang, Yan Cheng, Wei Qi该论文提出CAM-DF(成本感知边际决策聚焦停止)方法,解决LLM代理在工具选择时如何平衡信息充足性与成本的问题。CAM-DF通过训练停止决策,在1,343个任务上评估,在τ-bench Retail数据集上相比预测-阈值基线方法获得更高收益。CAM-DF-lite作为其轻量可解释变体,在异质成本和高成本压力下达到最先进水平。在线执行中,CAM-DF使代理暴露于37%更少工具,同时保持任务成功率不变。该方法无需微调底层LLM,可即插即用于现有工具排序流程。论文CAM-DFCAM-DF-liteLLM代理推荐理由:这篇论文教你如何让AI代理少花钱多办事,用CAM-DF方法在成本压力下精准选择工具,比传统方法更高效。原文稍后读已读值得跟进有用关注 CAM-DF
10:36官方账号arXiv cs.AI@Anastasiia Kuvshinova, Seungmin Jin精选本文提出Graph Traversal Agent,一种结合LLM推理与确定性图操作的根因分析代理,用于诊断Kubernetes事件。该方法通过类型化证据图、LangGraph状态机和独立验证阶段,确保分析结果可审计且不依赖场景捷径。在ITBench基准测试中,系统在23个场景子集上根因实体F1从0.6087提升至0.9130,但消融实验显示部分提升源于提示词优化,去除提示后F1降至0.6958。研究强调,真正的泛化能力需通过提示消融、级联源检查等轻量级验证来区分。目前工作限于ITBench OpenTelemetry-demo快照,未声称生产就绪。论文Kubernetes根因分析LLM代理推荐理由:Kubernetes运维团队终于有了一个可审计的根因分析方案——Graph Traversal Agent通过图约束和独立验证,避免了LLM常见的幻觉和场景作弊。做K8s可观测性或事件诊断的开发者,值得看看这个结合图遍历与LLM的框架设计。原文稍后读已读值得跟进有用关注 Kubernetes
09:59官方账号arXiv cs.AI@William Lugoloobi, Samuelle Marro, Jabez Magomere, Joss Wright, Chris Russell精选研究人员发现,基于LLM的浏览器代理在网页上执行任务时,其操作序列和交互时间可以被被动JavaScript追踪器捕获,从而以高达96%的F1分数识别出底层模型。该研究覆盖了14个前沿LLM和四个网页环境,包括信息检索和购物任务。攻击者可以利用此漏洞针对已知模型漏洞发起定向攻击。虽然注入随机时间延迟可以降低分类器性能,但重新训练后仍能恢复大部分识别能力。研究团队已发布相关工具和标注数据集。论文LLM代理安全/隐私指纹识别推荐理由:这项研究揭示了LLM代理的一个重大安全风险——网站可以被动识别你的AI模型,做AI安全和隐私保护的团队值得关注,建议开发者检查自己的代理是否容易通过UI痕迹被指纹识别。原文稍后读已读值得跟进有用关注 LLM代理