#智能体安全
共 16 条 · 7 天 1 条 · 30 天 1 条
信息流里打上「智能体安全」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月5日
8月11日
ColluSkill:对抗性跨技能组合攻击与ChainGuard防御框架
这篇论文讲了一个新攻击思路:把恶意技能拆成多个看似无害的小技能,组合起来就能绕过扫描器。还给了防御方案ChainGuard,做智能体安全的人值得看看。
7月30日
论文10:58
MemSecBench:追踪智能体记忆从持久化到后果与修复的中毒过程这篇论文搞了个MemSecBench,专门测AI记忆会不会被黑,结果84%的案例恶意记忆都能长存,而且不同记忆系统差别很大,做AI安全的朋友应该看看。
Perplexity 开源智能体安全层 Numbat,贡献给 Open Secure AI 联盟
Perplexity 把自家用的智能体安全工具 Numbat 开源了,能实时监控并阻止智能体干坏事,搞 AI Agent 的朋友可以看看。
7月28日
7月22日
7月20日
7月17日
Bad Memory:评估智能体系统记忆中的提示注入风险
这篇论文用Claude Code和OpenAI Codex实测了记忆注入攻击,发现一旦恶意指令写入记忆,后续会话都危险,搞AI安全的一定要看看。
7月16日
7月14日
AHA:自动化红队测试发现Claude Code和Codex的智能体漏洞
想了解如何自动化挖Claude Code和Codex的漏洞?这篇论文提出了AHA方法,比现有方法强14%,还能跨场景复用。搞智能体安全的值得看。
6月29日
阿里云发布Constraint Infra,安全治理AI Agent
阿里云出了个Agent安全治理框架,能动态控制prompt和规则,还能限制token,让高风险任务也安全运行。适合搞Agent开发的团队。
6月18日
6月1日
微软 Agent Governance Toolkit 实现:安全 AI 智能体工具使用
做 AI 智能体安全治理的开发者终于有了可落地的参考——微软的治理层框架直接可用,建议在 Colab 上跑一遍,能快速理解策略、审批、审计日志如何集成。
5月25日
5月20日
OpenAI 团队在智能体安全领域取得进展,Codex 是关键一步
智能体安全是当前 AI 落地的核心瓶颈,OpenAI 的 Codex 方案将安全控制嵌入开发流程,做 AI 应用开发的团队值得关注这一方向。
5月17日
Google DeepMind 论文:AI 智能体的真正安全问题是环境而非模型
这篇论文把 AI 智能体的安全边界从模型内部扩展到了整个互联网环境,做智能体开发和安全研究的团队必须重新审视攻击面——你的智能体可能正在被看不见的网页内容操控。