主要来源arXiv: Anthropic
查看原文事件专题 · 官方一手
Bad Memory:评估智能体系统记忆中的提示注入风险
该论文研究了基于记忆的智能体系统中的提示注入攻击风险,评估了Anthropic Claude Code和OpenAI Codex两个系统,以及Claude Haiku 4.5、Claude Opus 4.7、GPT-5.2和GPT-5.5四个模型。实验发现,攻击者难以让代理用不受信任的外部内容覆盖自身记忆文件,但已经植入记忆的有效载荷可成功影响当前和未来会话。攻击成功率和载荷持久性在不同系统、模型和攻击目标间差异显著。研究揭示持久记忆改变了提示注入的威胁模型,需设计保护记忆更新的防御机制。
当前结论
这篇论文用Claude Code和OpenAI Codex实测了记忆注入攻击,发现一旦恶意指令写入记忆,后续会话都危险,搞AI安全的一定要看看。
11 个信源56° AI 热度最后更新 2026/7/16 06:13:48
证据链
相关来源 1Ethan Mollick
查看原文相关来源 2Claude Code: GitHub Releases
查看原文相关来源 3IT之家
查看原文相关来源 4Lovable
查看原文相关来源 5AI Engineer
查看原文相关来源 6AK
查看原文相关来源 7@koltregaskes
查看原文相关来源 8Simon Willison
查看原文相关来源 9小互
查看原文相关来源 10Decoder
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。