事件专题 · 官方一手

Bad Memory:评估智能体系统记忆中的提示注入风险

该论文研究了基于记忆的智能体系统中的提示注入攻击风险,评估了Anthropic Claude Code和OpenAI Codex两个系统,以及Claude Haiku 4.5、Claude Opus 4.7、GPT-5.2和GPT-5.5四个模型。实验发现,攻击者难以让代理用不受信任的外部内容覆盖自身记忆文件,但已经植入记忆的有效载荷可成功影响当前和未来会话。攻击成功率和载荷持久性在不同系统、模型和攻击目标间差异显著。研究揭示持久记忆改变了提示注入的威胁模型,需设计保护记忆更新的防御机制。

当前结论

这篇论文用Claude Code和OpenAI Codex实测了记忆注入攻击,发现一旦恶意指令写入记忆,后续会话都危险,搞AI安全的一定要看看。

11 个信源56° AI 热度最后更新 2026/7/16 06:13:48

证据链

相关来源 2Claude Code: GitHub Releases
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情