8月18日
10:28
10:28官方一手arXiv: DeepSeek@Zonghao Ying, Xiangfan Wu, Huiyu Wu, Xing Zheng, Huangsheng Cheng, Xiaorong Shi, Jing Guo
Tencent 发布论文,用 AI-Infra-Guard(A.I.G)对 DeepSeek Harness(DSH)进行间接提示注入评估。实验包含 14,560 次受控执行,覆盖 16 个间接内容渠道、35 个载荷目标和 12 种攻击方法。最强攻击成功率在文本模式下为 17.0%(伪造完成攻击,LLMJudge 判定),文件模式下隐藏 Unicode 攻击达 25.5%(RuleJudge 判定),技能渠道为 16.0%。研究还对比了 RuleJudge 与 LLMJudge 的判定差异,并给出了缓解建议。代码已开源。
事件专题

推荐理由:腾讯用 A.I.G 把 DeepSeek Harness 翻来覆去测了 1.4 万多次,隐藏 Unicode 攻击成功率能到 25.5%。想自查提示注入的可以看看这个框架。
8月8日
7月29日
02:01
7月25日
09:09
09:09官方账号Simon Willison’s Weblog博客/媒体
精选
Anthropic 的 Claude Opus 5 在提示注入(prompt injection)防护上取得显著进展。根据官方系统卡和红队评估,Opus 5 是 Anthropic 迄今最难以被成功提示注入的模型。这一结果基于多项 PI 评估和对抗测试,标志着大模型安全性的一次重要提升。
事件专题

推荐理由:Anthropic 的 Opus 5 在防提示注入上做到了史上最强,红队测试都很难攻破,安全团队值得关注。
7月17日
7月16日
01:14
01:14官方一手OpenAI Blog博客/媒体
OpenAI发布了GPT-Red,一个自动化红队测试系统。该系统采用自我对弈机制,让大模型相互对抗生成测试用例,以提升对提示注入等攻击的鲁棒性。GPT-Red旨在通过自动化的对抗训练,持续改进AI模型的安全性和对齐性。
事件专题

推荐理由:OpenAI搞了个新系统叫GPT-Red,让模型自己打自己来找出漏洞,专门防提示注入这类攻击,挺实用的。
6月27日
6月16日
14:23
14:23官方账号AlphaSignal@AlphaSignalAI
精选
NVIDIA开源了AI技能安全扫描器SkillSpector。研究发现26.1%的已发布AI技能存在漏洞,36%包含提示注入向量。SkillSpector无需扫描恶意代码即可检测危险特性,帮助开发者避免在安装未扫描技能时的常见风险。该工具专为检查AI技能潜在安全问题设计,可集成到开发流程中。
事件专题

推荐理由:NVIDIA开源了SkillSpector,专门扫描AI技能的漏洞和提示注入。别像99%的开发者那样不检查就直接装,先扫一下再安心用。
6月12日
6月2日
5月27日
11:06
11:06官方账号Simon Willison’s Weblog博客/媒体
76°
微软的 Copilot Cowork 产品存在安全漏洞,允许攻击者通过提示注入实现数据外泄。该漏洞利用代理发送包含外部图片的邮件,当用户打开邮件时,图片会触发网络请求,从而泄露数据。由于 OneDrive 可生成预认证下载链接,攻击者能通过提示注入获取这些链接并下载文件。这凸显了智能体系统在防止数据泄露方面的持续挑战。
推荐理由:这个漏洞揭示了智能体系统设计中的核心安全痛点,使用 Microsoft Copilot 的团队需要立即关注并评估风险,建议检查相关配置并限制代理的邮件发送权限。