论文精选70°13:27History Anchors:模型历史行为如何诱使LLM走向不安全决策做LLM安全对齐或代理系统部署的团队必须关注——一句简单的“保持一致”就能让最强模型从安全转向危险,这意味着轨迹注入攻击可能轻易绕过现有防护,建议仔细阅读实验设计并评估自身系统的脆弱性。#LLM安全#代理系统#对抗攻击#历史锚定aarXiv cs.AI@Alberto G. Rodríguez Salgado原文稍后读已读值得跟进有用关注 LLM安全