12:35官方账号arXiv cs.AI@Natalie Isak, Matthew Dressman该论文指出,最强大的AI部署由多个专业智能体协作完成,而现有滥用检测只覆盖单会话或多轮对话,无法拦截跨会话攻击。攻击者可将有害目标拆解为多个无害步骤,分别在隔离的智能体会话中执行,从而累积出危险能力。作者提出Magnet检测方法,以用户ID为关联维度,跨会话聚合能力痕迹,并将分散的证据碎片组装为紧凑的证据包供检测器判断。实验表明,跨会话目标分解比等效单会话或多轮攻击更能诱发有害能力。论文MagnetAI安全智能体推荐理由:讲清楚了跨会话攻击怎么绕过检测,还给了个叫Magnet的解法,做AI安全的值得看看。原文稍后读已读值得跟进有用关注 Magnet