AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

Salience Induction

共 1 条相关 AI 资讯
7月21日
11:41
11:41官方一手arXiv: DeepSeek@Xingfu Zhou, Pengfei Wang, Yuan Zhou, Wei Xie, Xu Zhou
精选
论文识别出多跳RAG系统的新攻击面——显著性诱导,通过调整检索事实的位置、强调和语义框架来误导推理,即使所有事实真实且无指令注入。定义六类显著性编辑操作符,在SalientWiki-MH基准上对GPT、Claude、Gemini、DeepSeek、Qwen五个模型族和ReAct、Reflexion、tool-calling三种架构评估,30%编辑预算下攻击成功率83.3%。最强基线防御后ASR仍达75.7%;提出的Salience Normalization防御将攻击成功率降至15.3%(标准攻击)和23.6%(自适应攻击)。
论文Salience InductionMulti-Hop RAGSalientWiki-MH

推荐理由:这篇论文揭露了RAG系统的新漏洞:即使事实正确也可能被误导。还给出了一个轻量级的防御方法,做Agent安全的人值得一读。
原文
精选全部日报登录