10:58官方账号arXiv cs.AI@Xuanze Chen, Xukang Xie, Wentao Fu, Jiajun Zhou, Shanqing Yu, Qi XuanMemSecBench是一个任务驱动的基准,用于评估智能体记忆系统的生命周期安全,包含310个案例,覆盖代码、科学、日常生活和办公等48个真实场景。该基准采用Write-Execute-Forget协议,在24种配置组合(2种智能体框架、4种记忆后端、3种LLM后端)下测试。结果显示恶意记忆在84.2%的案例中持续存在,完整攻击成功率为50.3%。成功中毒案例中,59.6%完成完整执行链,56.1%实现选择性修复。与原生配置相比,攻击成功率最大差异达16.1个百分点,选择性修复差异达41.3个百分点。论文MemSecBench智能体安全记忆中毒推荐理由:这篇论文搞了个MemSecBench,专门测AI记忆会不会被黑,结果84%的案例恶意记忆都能长存,而且不同记忆系统差别很大,做AI安全的朋友应该看看。原文稍后读已读值得跟进有用关注 MemSecBench
15:13官方账号arXiv cs.LG@Jun Wen Leong研究发现LLM Agent在持续记忆中毒攻击下存在行为不变性:成功攻击必须调用memory_recall_fact后再调用email_send_email。仅凭该规则的检测AUC达0.9563,基于19个轨迹特征的随机森林分类器将AUC提升至0.9904(BCa 95% CI [0.987, 0.993])。跨9个模型(7B-120B参数)验证,6/9的留出测试AUC为1.000。该签名可泛化至GPT-4.1和GPT-4o等前沿模型,无需重新训练。通过工具调用日志即可区分记忆通道攻击与提示注入攻击。论文LLM Agent记忆中毒行为检测推荐理由:这篇论文发现了一个简单规律就能检测AI Agent的记忆中毒攻击,准确率高达99%,还能区分不同攻击类型,非常实用。原文稍后读已读值得跟进有用关注 LLM Agent