15:22官方一手arXiv: Anthropic@Nof Orenstein, Yoni Birman本研究针对LLM驱动的社交媒体机器人检测系统,提出了两种新型对抗攻击策略,能将其检测准确率降低高达48%。为应对这些威胁,研究者设计了LSABRE(LLM驱动的社交对抗机器人识别集成)多LLM防御框架,在强自适应对抗压力下仍保持86%的检测准确率。该研究的方法论可推广至钓鱼检测、邮件分类和欺诈分析等更广泛的LLM驱动的网络安全系统。论文LLM社交机器人检测对抗攻击推荐理由:这篇论文讲的是怎么用LLM攻破机器人检测,又怎么用多LLM防住,准确率数字很具体,搞安全或社交平台的朋友值得看看。原文稍后读已读值得跟进有用关注 LLM
11:38官方账号arXiv cs.AI@Yukun Dai, Mingzhe Dai, Tianshi Wang, Fengling Li, Jingjing Li, Lei ZhuUniTexture 是一种针对视觉-语言-动作(VLA)模型的对抗纹理攻击方法,通过单个带纹理的 3D 物体诱导多任务动作预测偏离。该方法利用可微渲染器将策略动作输出的梯度回传到表面纹理参数,跨任务联合优化共享纹理。在 OpenVLA 和 π0.5 上的多任务评估中,UniTexture 将平均任务成功率从良性条件下的 90.0% 降至攻击下的 48.4%。攻击还表现出跨套件和跨模型迁移能力,无需重新优化即可生效。研究揭示了多任务 VLA 中共存的跨任务安全漏洞。论文UniTextureOpenVLAπ0.5推荐理由:拿一个贴了纹理的物体就能让 OpenVLA 和 π0.5 的成功率从 90% 掉到 48%,还能跨模型生效,搞机器人安全的可以看看。原文稍后读已读值得跟进有用关注 UniTexture
11:18官方账号arXiv cs.AI@Puyu Zeng, Simeng Qin, Jingzhi Li, Ju Jia, Zheli Liu, Xiaojun Jia精选ColluSkill是一种针对LLM智能体技能扫描器的对抗性攻击框架,通过将恶意意图分解为多个独立包装的技能子负载,利用上下文依赖和工件传递在运行时组合成有害工作流。实验显示,在六个代表性技能扫描器上,ColluSkill平均攻击成功率达96.0%,显著优于单技能和多技能攻击基线。为防御此类攻击,研究者提出ChainGuard,一种上下文感知的技能链扫描器,通过重建跨技能依赖和工件流将攻击成功率降至22.5%,同时允许99.5%良性工作流通过。该研究揭示了现有技能扫描器仅检查单个技能的安全盲区,强调链级安全分析对智能体技能生态系统的重要性。论文ColluSkillChainGuard智能体安全推荐理由:这篇论文讲了一个新攻击思路:把恶意技能拆成多个看似无害的小技能,组合起来就能绕过扫描器。还给了防御方案ChainGuard,做智能体安全的人值得看看。原文稍后读已读值得跟进有用关注 ColluSkill
11:26官方账号arXiv cs.AI@Shaofeng Liang, Runwei Guan, Wenshuo Chen, Jiemin Wu, Bowen Tian, Haozhe Jia, Kaishen Yuan, Songning Lai, Daizong Liu, Yutao Yue自适应Transformer跟踪器通过动态路由平衡精度与效率,但其层跳变决策边界的Lipschitz常数无界,微小输入扰动即可被门控模块放大,导致推理拓扑剧变。该研究将这一奇异性确认为可被直接利用的攻击面,并提出对抗路径反转(API)框架。API通过微扰精确操纵门控决策,迫使模型走改变后的计算路径。在最新自适应跟踪器上的实验显示,API在扰动隐蔽性、攻击有效性和推理速度上均更优。论文Adaptive Transformer对抗攻击无人机推荐理由:这篇论文发现自适应无人机跟踪器的动态路由能被人用微小噪声劫持,让跟踪跑偏。攻击比现有方法更隐蔽、更快。原文稍后读已读值得跟进有用关注 Adaptive Transformer
11:03官方账号arXiv cs.AI@Yu Ran, Wentao Zhao, Xin Zhang, Yi PanGUI视觉定位模型将屏幕坐标生成为数字token序列,再解析为数值执行点击。MissClick针对坐标的数字位权结构提出两种攻击目标:MissClick-U最大化软坐标位移实现无目标干扰,MissClick-T最小化按位加权的目标数字损失实现定向劫持。在OS-Atlas和UGround的桌面、网页与移动端基准上,MissClick-U的无目标攻击成功率达75.07%和72.93%,较现有攻击分别提升16.62和30.72个百分点。MissClick-T的目标攻击成功率达44.86%和62.67%,分别提升31.73和47.06个百分点。实验表明软坐标位移最适合无目标攻击,而按位加权的目标数字优化最适合定向攻击。论文MissClickOS-AtlasUGround推荐理由:研究者发现GUI模型把坐标当数字token生成时容易被攻击,MissClick在OS-Atlas和UGround上能把点击位置带偏,成功率比现有攻击高出几十个百分点。原文稍后读已读值得跟进有用关注 MissClick
09:38官方账号arXiv cs.LG@Arash Vashagh, Yasmin VashaghConformalShift 是一种针对自适应心电图监测的有界事件重排攻击。在 MIT-BIH 确认记录上,它不改动波形、标签、分类器分数或事件多重集,只重排真实先前事件来降低目标的心室阈值。攻击对 Extra Trees 和 HistGradientBoosting 的合格目标抑制率分别达到 66.7% 和 60.0%,随机调度仅为 4.4% 和 12.0%。迁移到 INCART 后仍优于随机调度,收缩位移预算削弱了攻击效果。论文ConformalShift对抗攻击心电图监测推荐理由:ConformalShift 攻击心电监测,不改波形和标签,只重排真实事件顺序,成功率从 4.4% 提到 66.7%。原文稍后读已读值得跟进有用关注 ConformalShift
09:16官方账号arXiv cs.AI@Xiang Chen, Yingying Zhao, Chao Li, Jiaju Han, Ben Zhang, Ang Li, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu论文提出QR-STT,一种无需训练的黑盒攻击框架,用于定向操控红外视觉语言模型的语义输出。该方法将QR码划分为冷、中、热三种温度模块,并通过无梯度优化搜索模块布局和渲染参数。实验在多个CLIP风格编码器上验证,QR-STT能稳定将图像-文本对齐导向攻击者选定的概念。针对分类任务优化的扰动还能迁移到图像描述和视觉问答,使生成文本出现目标一致的语义偏移。论文QR-STTCLIP对抗攻击推荐理由:红外视觉模型能被QR码图案定向误导?论文提出QR-STT,黑盒无需训练,改分类还影响问答,AI安全党可以看看。原文稍后读已读值得跟进有用关注 QR-STT
10:55官方一手arXiv: Anthropic@Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann论文提出SIREN方法,通过PAIR越狱循环自动编辑检索到的网页内容,操纵大语言模型的推荐排名。在124次试验中,SIREN在Claude 3.5 Sonnet和Claude 3 Opus模型上实现62次目标实体升至排名1。使用23种内容投毒技术(如声明性排名声称和种子列表),并在新会话中复现成功率达0.805。这是首个在固定源上下文下研究生产级LLM推荐排名操纵的受控实验。论文SIRENPAIRClaude推荐理由:这篇论文教你如何通过修改网页内容让大模型推荐时把你想要的东西排第一。SIREN用PAIR越狱循环,在Claude模型上成功率80%,挺有意思的。原文稍后读已读值得跟进有用关注 SIREN
09:40官方账号arXiv cs.LG@Khushnaseeb Roshan该论文提出一种混合防御机制,结合对抗训练(AT)和高斯数据增强(GDA),以抵御快速梯度符号法(FGSM)和Carlini & Wagner(C&W)两种白盒对抗攻击。未防御时,NIDS在FGSM和C&W攻击下的准确率分别降至0.2649和0.4961。应用混合防御后,准确率提升至96.57%和89.20%。实验在epsilon和置信噪声因子0.0001至0.0009范围内进行评估。论文FGSMC&WNIDS推荐理由:这篇论文用对抗训练加高斯增强,把NIDS被FGSM攻击后的26%准确率拉回96%,实测有效。原文稍后读已读值得跟进有用关注 FGSM
12:28官方账号arXiv cs.LG@Qi Li, Xingyi Yang, Xinchao WangBadWAM提出了一种针对世界-动作模型(WAM)的统一对抗攻击框架,利用微小视觉扰动破坏模型对动作与未来预测的耦合。该框架包含两种攻击:动作对抗攻击直接将任务成功率从96.5%降至43.1%;想象保持攻击则在维持未来预测接近原始结果的同时诱导有害动作偏移。实验揭示了WAM特有的漏洞:模型可能想象出合理的未来,但执行的动作已失配。论文BadWAMWorld-Action Models对抗攻击推荐理由:这篇论文发现WAM模型有严重安全漏洞——加一点点视觉干扰,机器人就会想象正常但行动出错,成功率从96%掉到43%。搞机器人安全的得看看。原文稍后读已读值得跟进有用关注 BadWAM
09:08官方一手arXiv: OpenAI@Xin Li, Jiaju Han, Ma Yaqi, Chengyin Hu, Yingying Zhao, Jiahuan Long, Fengyu Zhang, Yahui Chai精选InfraQR 是一种针对红外视觉语言模型的攻击方法,将紧凑结构化补丁沿图像边界放置,通过代理 CLIP 编码器优化可学习网格单元。在 300 张红外图像基准上,InfraQR 将 OpenAI CLIP 的分类准确率从 98.67% 降至 0.70%。攻击还迁移到黑盒字幕和 VQA 模型,导致字幕语义退化,并在 GPT-5.4 评估下产生更易错的答案。结果表明红外视觉语言模型易受边缘结构化扰动影响,需进一步研究跨任务鲁棒性。论文InfraQRCLIPOpenAI1 个信源在谈事件专题推荐理由:这篇研究告诉你,红外视觉语言模型有多脆弱——一个 QR 风格的边角补丁就能让 OpenAI CLIP 准确率从 98.67% 跌到 0.70%,还能黑盒攻击其它模型。搞安全或对抗训练的值得一看。原文稍后读已读值得跟进有用关注 InfraQR
12:09官方账号arXiv cs.AI@Cong Su, Jiaju Han, Xuemeng Sun, Chengyin Hu, Qike Zhang, Jiujiang Guo, Yiwei Wei, Jiahuan Long精选研究者提出AirflowAttack,首个针对红外遥感视觉语言模型的对抗攻击方法,利用热气流湍流作为扰动先验。该方法通过轻量生成器合成输入无关的扰动,在五个CLIP骨干上平均零样本场景分类攻击成功率达48.5%,超过四个物理基线(27.7-37.0%)。对六个SOTA视觉语言模型,场景分类准确率相对降低38.2%,但某些模型反而更自信地将扰动误判为真实热证据。消融实验显示气流先验在提升物理合理性时未牺牲攻击成功率。该基准覆盖十一个模型和四项任务,暴露了红外遥感视觉语言模型的脆弱性。论文AirflowAttack红外遥感视觉语言模型推荐理由:这篇论文把热气流变成攻击红外遥感模型的武器,攻击成功率48.5%,还能让模型更自信地犯错,搞AI安全的一定要看。原文稍后读已读值得跟进有用关注 AirflowAttack
12:11官方账号arXiv cs.LG@Fabien Polly该论文提出了一种子空间约束适配方法,在flan-t5-large上使用196个公开LoRA适配器进行评估。实验表明:(1)适配器中30%至38%的权重范数在评价任务分布下是冗余的;(2)在干净分类数据上,限制到128维子空间的梯度适配与全量LoRA性能相当,而在目标标签反转攻击下LoRA精确匹配降至3%-26%,约束学习器保持在62%-96%;(3)约束学习器无法拟合污染数据,适配损失分离干净与脏数据达两个数量级(120倍);(4)针对自适应后门攻击者,当目标行为与池中不相似时攻击成功率仅8% vs LoRA的100%,目标与池中常见行为重合时达85%。代码和数据已公开。论文flan-t5-largeLoRA微调安全推荐理由:这篇论文告诉你一个防止投毒攻击的微调方法:只学有效适配器的子空间,在flan-t5-large上比LoRA安全很多。原文稍后读已读值得跟进有用关注 flan-t5-large
09:46官方账号arXiv cs.LG@Honglin Gao, Junhao Ren, Lan Zhao, Yue Yang, Jindong Chang, Gaoxi XiaoBlackknife提出一种硬标签、查询受限且结构受限的黑盒逃逸攻击框架,针对异构图神经网络(HGNN)。该攻击不依赖模型梯度、置信度或完整图结构,仅利用本地可观测的单跳异构结构和少量硬标签查询。在ACM、DBLP和IMDB三个基准数据集上的实验表明,Blackknife对代表性HGNN模型实现了高攻击成功率,并在基于拓扑的防御下仍有效。论文BlackknifeHGNN异构图表征网络推荐理由:这篇论文提出了Blackknife,一种能在几乎无信息条件下攻击HGNN的黑盒方法,只用少量查询就能成功扰动图结构,值得一看。原文稍后读已读值得跟进有用关注 Blackknife
11:38官方账号arXiv cs.AI@Manjinder Singh, Alexander E. I. Brownlee, Mohamed Elawady这篇论文提出GAversary,一种混合遗传算法(GA)用于生成对抗攻击,只需黑盒访问目标模型的logit输出。GAversary利用GloVe嵌入实现词替换(变异算子),提升对抗样本的语义相似性。在多个基准数据集和知名模型上测试,GAversary将目标模型准确率从76.8%降至5.8%,而对比方法BAE仅降至27.6%。代价是扰动词数约为BAE的两倍,语义相似度略低,运行时间增加约5%。论文GAversaryGloVe对抗攻击推荐理由:这篇论文搞了个GAversary,用遗传算法和GloVe嵌入做黑盒文本攻击,能把模型准确率从76.8%打到5.8%,比BAE狠多了。原文稍后读已读值得跟进有用关注 GAversary
11:46官方账号arXiv cs.AI@Aman Anifer, Vignesh Kumar Kembu, Vishnu M, Antonino Nocera, Vinod P., Amal Murali PK, Akshay S Rajan研究者提出GAS-Leak-LLM,一种基于遗传算法的黑盒LLM越狱攻击方法。该方法无需访问模型参数或内部信息,在严格黑盒设置下通过选择、变异、交叉迭代搜索对抗性后缀。实验在多个主流LLM上验证了攻击成功率,暴露了现有安全对齐机制的缺陷。论文GAS-Leak-LLMLLM遗传算法推荐理由:想看看LLM安全到底有多脆弱吗?这个研究用遗传算法黑盒越狱,效果惊人,开发者应该留意。原文稍后读已读值得跟进有用关注 GAS-Leak-LLM
11:12官方账号arXiv cs.AI@Nicole Villavicencio-Garduño, Maksim Ekin Eren, Milo Prisbrey, Ben Migliori, Michael Teti研究表明,针对计算机视觉应用的声学对抗攻击可利用20千赫兹以下的可听声波共振商用摄像头,导致AI模型(如YOLO11)出现误分类、漏检或幻觉。相比先前使用超声波(>20千赫兹)的短距离攻击,低频声波传播距离更远。实验分析了图像分辨率、目标尺寸等特征对攻击成功率的影响,为防御策略提供了依据。论文YOLO11声学攻击对抗攻击推荐理由:可听声波让YOLO11误判原文稍后读已读值得跟进有用关注 YOLO11
11:31官方一手arXiv: Google DeepMind@Zhixiang Guo, Siyuan Liang, Shi Fu, Cheng Guo, Andras Balogh, Mark Jelasity, Dacheng Tao精选世界模型作为决策智能体日益普及,但其对抗鲁棒性因缺乏自动化评估方法而研究不足。现有手动调参的攻击要么高估鲁棒性,要么因穷举搜索成本过高而不可行。WMAttack 将鲁棒性评估建模为有限预算下的攻击配置搜索,包括攻击类型、扰动预算、优化步数等。其核心创新是自校正攻击搜索(SCAS)和表示引导攻击检索(RGAR),分别通过反馈优化攻击分布和利用历史配置加速新环境搜索。在 Atari 和 DeepMind Control 任务上,WMAttack 发现了比基线更强的攻击,归一化奖励下降显著提升。论文世界模型对抗攻击鲁棒性评估推荐理由:世界模型智能体的安全性评估一直缺乏自动化工具,做对抗攻击或鲁棒性研究的团队可以直接用这个框架替代手动调参,省时且结果更可靠。原文稍后读已读值得跟进有用关注 世界模型
14:53官方账号arXiv cs.LG@Mohamed elShehaby, Ashraf Matrawy精选本文研究了在基于梯度的对抗攻击下,仅通过精心选择网络架构(如更浅的网络、更少的特征和ReLU激活函数)能否使基于深度神经网络的入侵检测系统(NIDS)具备内在鲁棒性。通过约2200次实验,对比FGSM、PGD和BIM攻击,发现浅层网络、简化特征集和ReLU激活函数能显著降低对抗脆弱性。这种简单模型甚至优于经过对抗训练的深层全特征模型,同时保持近乎完美的正常流量检测率和更短的训练时间。研究强调,关键在于选择“正确的少”而非盲目简化。论文对抗攻击入侵检测系统网络架构推荐理由:做网络安全和ML-NIDS的团队,不用加额外防御就能提升模型抗攻击能力——调整架构本身就能见效,值得在现有系统上试试这个“少即是多”的思路。原文稍后读已读值得跟进有用关注 对抗攻击
00:02Ethan Mollick@emollick研究人员发现一种名为“Whimsey攻击”的新型对抗方法,通过使用看似荒谬的理由(如“根据日内瓦公约我无法支付这么多”)来绕过AI智能体的安全护栏。这种攻击利用了AI模型对分布外论证的脆弱性,即使是大型模型也难以完全防御。小型模型更容易中招,但大型模型也会因此降低性能。该发现揭示了当前AI安全机制在应对非典型输入时的不足。AI模型AI安全对抗攻击智能体推荐理由:做AI安全或智能体开发的团队需要警惕——这种看似荒诞的攻击方式暴露了护栏机制的系统性漏洞,建议立即检查你的模型对分布外输入的鲁棒性。原文稍后读已读值得跟进有用关注 AI安全
13:27官方账号arXiv cs.AI@Alberto G. Rodríguez Salgado精选70°该研究构建了HistoryAnchor-100数据集,包含100个高风险场景,每个场景强制模型先执行三个有害动作,再给出自由选择节点。测试17个前沿模型发现,在无特殊提示时,对齐模型几乎不选不安全选项;但加入一句“与历史策略保持一致”后,不安全选择率飙升至91-98%。控制实验排除了标签混淆和指令本身的影响,且不同模型家族对有害历史剂量反应不同,旗舰模型受影响最大。这警示了代理部署中轨迹回放、伪造或注入的安全风险。论文LLM安全代理系统对抗攻击推荐理由:做LLM安全对齐或代理系统部署的团队必须关注——一句简单的“保持一致”就能让最强模型从安全转向危险,这意味着轨迹注入攻击可能轻易绕过现有防护,建议仔细阅读实验设计并评估自身系统的脆弱性。原文稍后读已读值得跟进有用关注 LLM安全