11:41官方一手arXiv: DeepSeek@Xingfu Zhou, Pengfei Wang, Yuan Zhou, Wei Xie, Xu Zhou精选论文识别出多跳RAG系统的新攻击面——显著性诱导,通过调整检索事实的位置、强调和语义框架来误导推理,即使所有事实真实且无指令注入。定义六类显著性编辑操作符,在SalientWiki-MH基准上对GPT、Claude、Gemini、DeepSeek、Qwen五个模型族和ReAct、Reflexion、tool-calling三种架构评估,30%编辑预算下攻击成功率83.3%。最强基线防御后ASR仍达75.7%;提出的Salience Normalization防御将攻击成功率降至15.3%(标准攻击)和23.6%(自适应攻击)。论文Salience InductionMulti-Hop RAGSalientWiki-MH推荐理由:这篇论文揭露了RAG系统的新漏洞:即使事实正确也可能被误导。还给出了一个轻量级的防御方法,做Agent安全的人值得一读。原文稍后读已读值得跟进有用关注 Salience Induction