7月30日
03:05
03:05官方账号Simon Willison’s Weblog博客/媒体
安全研究员Håkon Måløy发现一种针对Microsoft Word Copilot的提示注入攻击变种,攻击者可在文档中嵌入隐藏指令,当Copilot处理该文档时,指令会操纵新文档并复制自身,形成自复制蠕虫。微软在负责任披露后获得144天修复期,但目前尚无全面缓解措施。此攻击利用Copilot对用户请求的解读机制,使恶意指令在不依赖原始文档的情况下持续传播。
推荐理由:Håkon Måløy发现了一种能自我复制的提示注入攻击,专门针对Word里的Copilot,会把隐藏指令传染给后续文档,微软还没完全修好。安全从业者可以看看这种新变种。
6月23日
08:23
08:23官方账号Simon Willison’s Weblog博客/媒体
Charles Ye、Jasmine Cui和Dylan Hadfield-Menell的论文发现,LLM在区分角色标签(如<system>、<think>、<assistant>)与用户输入时,更关注文本的书写风格而非实际语义。通过将攻击文本“去风格化”(destyling)改写,使其看起来与特权文本格式不同,平均攻击成功率从61%骤降至10%。该研究表明,当前模型缺乏真正的角色感知,持续提示注入防御仍是难题。
推荐理由:这篇论文揭示了一个反直觉的发现:LLM会被文本的风格欺骗,而不是内容。研究者用简单的'去风格化'就能把攻击成功率从61%打到10%,对理解AI安全很有启发。
6月20日
01:55