安全团队看这个:论文用 NeMo Guardrails 给 SOC 的 LLM 加护栏,注入识别召回率从 25.0% 干到 94.5%,还放出了对抗测试语料,思路可以直接抄。
#提示词注入
共 18 条 · 7 天 3 条 · 30 天 8 条
信息流里打上「提示词注入」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
用 NeMo Guardrails 约束 LLM 自动处置安全告警:注入召回率从 25.0% 提到 94.5%
10月7日
AdvSim2Real:在Web世界模型中同时训练任务、注入攻击与智能体
页面上的恶意提示能劫持浏览器智能体,这篇论文让任务、攻击和智能体在模拟器里互相对抗着变强,4B 小模型对未见攻击完成率提升 33.6%。
SecureSD:针对投机解码安全风险的防护方法
用小模型加速大模型推理的投机解码原来有安全漏洞,这篇论文定位到问题出在前几个 token,SecureSD 只需对早期 token 加严验证就能补上,做推理部署的可以看看。
9月29日
9月26日
9月22日
9月17日
8月15日
8月13日
8月10日
8月8日
8月5日
行业21:41
CrowdStrike携手AWS推出AI安全挑战赛,总奖金10万美元CrowdStrike和AWS搞了个10万美元奖金的AI红队挑战赛,用提示词注入去策反智能体,想练手的可以上。
IT之家原文
7月25日
Opus 5零提示注入成功率,或解决AI智能体最大安全缺陷
Anthropic的Opus 5在Auto Mode下把浏览器智能体的提示注入防御做到了100%,129个测试全过,这可能彻底解决智能体安全难题。
7月6日
6月30日
6月7日
微软警告:Claude Code 漏洞可致 GitHub 凭证泄露
用 Claude Code 做自动化流程的团队注意了——这个漏洞能让攻击者通过一条工单偷走你的 GitHub 凭证,建议立即升级到 2.1.128 版本。
5月26日
微软 Copilot Cowork 智能体曝安全风险,机密文件恐外泄
企业安全团队和 Microsoft 365 管理员需要立即关注——这个漏洞让攻击者能绕过权限控制窃取机密文件,建议检查 Cowork 的自动技能加载策略并限制外部内容读取。
IT之家原文