09:38官方账号arXiv cs.AI@Haoyu Zhang, Xiangchen Guan, Shibo Zheng, Mohammad Zandsalimy, Shanu Sushmita论文报告了一个反直觉现象:在编码越狱提示旁附加一张无关诱饵图像,能显著降低视觉语言模型的黑盒防御攻击成功率。实验覆盖五个前沿VLM、两种编码攻击和三种黑盒防御,其中ECSO防御在纯文本输入下ASR几乎不变,附加诱饵后最多下降73个百分点。空白画布和自然照片均能复现效果,表明起作用的是图像存在而非内容。但无条件附加诱饵会使良性拒绝率升至20%–79%,需配合轻量检测器使用。论文ECSOVLM越狱推荐理由:这篇论文发现,给越狱提示配张无关图片,能让ECSO防御的攻击成功率掉73个百分点。不是新防御,但交互很反直觉。原文稍后读已读值得跟进有用关注 ECSO