#对抗攻击
共 24 条 · 7 天 2 条 · 30 天 2 条
信息流里打上「对抗攻击」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月6日
论文09:47
ST:用原始-对偶正则化提升可迁移对抗攻击的隐蔽性arXiv 上这篇论文提出 ST 攻击包装器,不换模型就能让对抗攻击更隐蔽,LPIPS 提升 17% 还不掉成功率,做对抗鲁棒性研究的可以看看。
9月3日
8月18日
8月14日
论文11:38
UniTexture:面向视觉-语言-动作模型的跨任务通用对抗纹理拿一个贴了纹理的物体就能让 OpenVLA 和 π0.5 的成功率从 90% 掉到 48%,还能跨模型生效,搞机器人安全的可以看看。
8月11日
ColluSkill:对抗性跨技能组合攻击与ChainGuard防御框架
这篇论文讲了一个新攻击思路:把恶意技能拆成多个看似无害的小技能,组合起来就能绕过扫描器。还给了防御方案ChainGuard,做智能体安全的人值得看看。
8月5日
论文11:03
MissClick:利用数字序列坐标攻击GUI定位模型研究者发现GUI模型把坐标当数字token生成时容易被攻击,MissClick在OS-Atlas和UGround上能把点击位置带偏,成功率比现有攻击高出几十个百分点。
论文09:38
ConformalShift:针对自适应心电图监测的定向事件重排攻击ConformalShift 攻击心电监测,不改波形和标签,只重排真实事件顺序,成功率从 4.4% 提到 66.7%。
8月3日
7月27日
论文10:55
SIREN:PAIR驱动下Web-RAG推荐系统的排名操纵研究这篇论文教你如何通过修改网页内容让大模型推荐时把你想要的东西排第一。SIREN用PAIR越狱循环,在Claude模型上成功率80%,挺有意思的。
7月21日
7月17日
7月9日
InfraQR:红外视觉语言模型的QR启发式结构化补丁攻击
这篇研究告诉你,红外视觉语言模型有多脆弱——一个 QR 风格的边角补丁就能让 OpenAI CLIP 准确率从 98.67% 跌到 0.70%,还能黑盒攻击其它模型。搞安全或对抗训练的值得一看。
7月8日
7月7日
论文12:11
Learning Only What Valid Adapters Can Express: Subspace-Constrained Adaptation Against Fine-Tuning Poisoning这篇论文告诉你一个防止投毒攻击的微调方法:只学有效适配器的子空间,在flan-t5-large上比LoRA安全很多。
6月30日
6月26日
6月16日
6月15日
5月25日
5月19日
更浅的网络+更少的特征+ReLU:无防御对抗攻击的ML-NIDS
做网络安全和ML-NIDS的团队,不用加额外防御就能提升模型抗攻击能力——调整架构本身就能见效,值得在现有系统上试试这个“少即是多”的思路。
5月15日
5月14日
History Anchors:模型历史行为如何诱使LLM走向不安全决策
做LLM安全对齐或代理系统部署的团队必须关注——一句简单的“保持一致”就能让最强模型从安全转向危险,这意味着轨迹注入攻击可能轻易绕过现有防护,建议仔细阅读实验设计并评估自身系统的脆弱性。