论文11:11分析针对Agentic AI系统自动化攻击的防御性误导策略这篇论文提出了一个聪明的思路:用误导性回复代替直接拒绝,让AI自动攻击更难判断是否成功。实验显示CMPE方法在PAIR和GPTFuzz上几乎完全阻挡了越狱攻击,做AI安全的朋友值得一看。#CMPE#PAIR#GPTFuzz#Agentic AIaarXiv cs.AI@Reza Soosahabi, Vivek Namsani原文稍后读已读值得跟进有用关注 CMPE