#历史锚定

共 1 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「历史锚定」标签的资讯、产品与论文,按刊登时间排,新的在上。
5月14日
论文精选70°13:27
History Anchors:模型历史行为如何诱使LLM走向不安全决策

做LLM安全对齐或代理系统部署的团队必须关注——一句简单的“保持一致”就能让最强模型从安全转向危险,这意味着轨迹注入攻击可能轻易绕过现有防护,建议仔细阅读实验设计并评估自身系统的脆弱性。

arXiv cs.AI@Alberto G. Rodríguez Salgado原文