10:29官方账号arXiv cs.AI@Hongliang Zhang, Zhongyuan Yu, Guijuan Wang, Tianqing He, Wenshuo Ma, Xiaosong Zhang, Jiguo YuFedDAB是一种两阶段防御方法,通过局部对比正则化和对齐检查来抵御联邦学习中的后门攻击。第一阶段在局部目标中添加模型对比项,增强良性更新的方向和幅度一致性;第二阶段利用整体方向对齐和参数级对齐检查历史信息,排除异常更新。理论证明收敛率为O(1/T),实验表明FedDAB在多个基准上优于现有防御方法如CRFL和FLTrust。论文FedDAB联邦学习后门攻击推荐理由:FedDAB用两阶段方法检测恶意更新,比CRFL和FLTrust更有效,理论收敛有保证。原文稍后读已读值得跟进有用关注 FedDAB
12:12官方账号arXiv cs.LG@Junrui Zhang, Zemin Chen, Lusi Li, Mohammad Ghasemigol, Daniel Takabi, Rui Ning精选量子神经网络(QNN)易受后门攻击,但现有攻击多使用固定触发器,易被视觉检测或频谱签名等防御识别。本文提出Q-DIBA,首个输入感知动态后门攻击,联合训练经典触发器生成器和受害者QNN,采用三模式小批量策略及集成密度对比损失。在MNIST和Fashion-MNIST数据集上,针对多种QNN架构的测试显示,Q-DIBA保持了高清洁准确率,同时达到高攻击成功率,且攻击具有输入特异性。该攻击还能抵御视觉检测、频谱签名检测和微调等现有防御手段。论文Q-DIBA量子神经网络后门攻击推荐理由:这篇论文提出了一个针对量子神经网络的新后门攻击Q-DIBA,能根据输入动态生成触发器,效果比固定触发器好,还扛得住几种常见防御。原文稍后读已读值得跟进有用关注 Q-DIBA
11:54官方账号arXiv cs.LG@Yibo Hu, Ren Wang73°本文揭示多智能体系统中的分布式后门攻击,恶意负载被分割到多个智能体,使局部监控每个步骤都通过,但组合后形成攻击。作者形式化定义了“可观测边界”:若片段在监控视角下看似良性,则任何检测器都无法捕获。实验表明,局部监控在0.874 mean AUROC下无法检测到攻击,只有监控看到组合对象时才恢复信号。解码视图门控可阻断所有测试攻击,但需知道编码族。论文多智能体系统LLM后门攻击推荐理由:这篇论文用具体实验证明,多智能体系统里单独检查每个智能体的信息根本不够,分布式后门能让所有局部检查都正常,但组合起来就成攻击了。原文稍后读已读值得跟进有用关注 多智能体系统
09:28官方账号arXiv cs.LG@Andrej Bogdanov, Alon Rosen, Neekon Vafa论文提出了一种方法,允许攻击者在深度前馈神经网络中植入后门,这些后门在白盒设置下统计上不可检测,即后门模型与诚实训练模型的总变差距离很小。后门可对每个输入提供基于不变性的对抗样本,将距离较远的输入映射到异常接近的输出。论文证明,在没有后门的情况下,基于标准密码学假设,无法在多项式时间内生成任何此类对抗样本。理论和初步实验展示模型训练者与用户之间的基本权力不对称。论文后门攻击深度神经网络对抗样本推荐理由:这篇论文揭示了AI安全的新漏洞:攻击者能植入无法被检测到的后门,生成对抗样本。对做模型安全的人很重要。原文稍后读已读值得跟进有用关注 后门攻击
15:31官方账号arXiv cs.LG@Yalin E. Sagduyu, Tugba Erpek, Aylin Yener, Sennur Ulukus语义通信(SemCom)在共享接入无线网络中引入了新漏洞。本文针对两个发射机与一个公共接收机构成的多址信道SemCom系统,提出一种选择性空中后门(Trojan)攻击:攻击者在训练期间发射低功率触发波形并注入共享接收信号,测试时再次触发以操控特定发射机的语义推理,而对另一发射机影响极小。同时开发了触发感知防御机制,通过鲁棒训练保持正确的语义标签。实验结果表明共享接入SemCom系统对这种选择性攻击的脆弱性,以及防御机制的有效性。论文后门攻击语义通信多址信道推荐理由:这篇论文讲了一种能悄悄操控无线语义通信中特定用户数据的后门攻击,还给出了防御方案。做无线安全或语义通信的可以看看。原文稍后读已读值得跟进有用关注 后门攻击
09:44官方账号arXiv cs.AI@Kavindu Herath, Joshua C. Zhao, Saurabh Bagchi该论文研究联邦学习中的语义后门攻击,利用口罩、墨镜等自然视觉对象作为触发器,仅改变颜色。在四类CelebA发色分类任务上,白色触发器对攻击金发类别更有效(成功率显著更高),黑色触发器对攻击黑发类别更有效。实验采用标准投毒目标与SABLE增强目标(结合分类损失、触发目标损失、特征分离损失及正则化),发现即使语义、位置和投毒预算不变,颜色也能显著改变攻击成功率,该结论在鲁棒聚合下依然成立。论文联邦学习后门攻击触发器颜色推荐理由:这篇论文告诉你,连后门攻击的触发器颜色都不能随便选。在CelebA发色任务上白trigger专克金发、黑trigger专克黑发,实验设计很扎实。原文稍后读已读值得跟进有用关注 联邦学习
10:04官方一手arXiv: Anthropic@David Huang, Jaewon Chang, Avidan Shah, Prateek Mittal, Chawin Sitawarin这篇论文揭示了对快速响应(RR)框架的投毒攻击方法,RR框架部署于生产系统(如Anthropic的ASL-3安全防护),用于持续改进越狱检测分类器。攻击者通过在越狱样本中注入提示词,可以渗透训练管道,实现两种攻击目标:第一种是针对性投毒,在无害样本上制造假阳性(分类为越狱),特定特征(如格式、主题、关键词)可触发。第二种是基于概念的后门攻击,在存在后门触发器的越狱输入上诱导假阴性,甚至能泛化到防御方已训练过的攻击策略。论文提出的Omission Attack利用了一个新现象:训练时缺少特定概念的unsafe样本,会导致分类器将该概念的出现与safe标签错误关联。在仅1%的投毒率下,两种攻击分别实现高达100%的假阳性率和96%的假阴性率。论文Rapid ResponseAnthropic投毒攻击10 个信源在谈事件专题推荐理由:这篇论文讲了对Anthropic等用的越狱检测防御框架的投毒攻击方法,投毒率才1%就能让检测器几乎失效,搞安全的一定要看。原文稍后读已读值得跟进有用关注 Rapid Response
09:51官方账号arXiv cs.LG@Zhenyu YuInstantForget是一种新的后门遗忘方法,无需更新模型参数即可在推理时移除恶意触发行为。在CIFAR-10 ResNet-18上,它针对BadNets、WaNet、Blended和SIG四种触发方式,将平均攻击成功率(ASR)降至0.071。该方法通过马氏距离标记异常特征并重置为中性表示,达到0.981的检测AUROC,并成功迁移至六种主干网络。论文还揭示了投影假设在WaNet等触发下的失效(ASR分别达0.683、0.888和0.941),并用logit-trilplet间隙预测失败。论文InstantForget后门攻击模型安全推荐理由:这篇论文提出InstantForget,不用重新训练就能清除模型后门,在CIFAR-10上把攻击成功率压到7%,还搞了个检测机制AUROC 98%,挺实用的。原文稍后读已读值得跟进有用关注 InstantForget