研究:Qwen2.5-7B-Instruct 可被训练出仅在多智能体场景触发漏洞的拓扑后门
有人把 Qwen2.5-7B 微调成只在多智能体环境里写漏洞代码的模型,单智能体测试完全查不出来,安全团队该看看这篇。
有人把 Qwen2.5-7B 微调成只在多智能体环境里写漏洞代码的模型,单智能体测试完全查不出来,安全团队该看看这篇。
这篇论文告诉你,连后门攻击的触发器颜色都不能随便选。在CelebA发色任务上白trigger专克金发、黑trigger专克黑发,实验设计很扎实。
这篇论文提出InstantForget,不用重新训练就能清除模型后门,在CIFAR-10上把攻击成功率压到7%,还搞了个检测机制AUROC 98%,挺实用的。