AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

安全传递

共 1 条相关 AI 资讯
9月1日
10:47
10:47官方账号arXiv cs.LG@Md Mokarram Chowdhury, Ernie Chang, Yang Li
精选73°
研究人员通过机械可解释性方法分析了角色扮演越狱如何导致模型拒绝有害请求的能力减弱。研究涵盖两个基准测试、三个模型家族和四种包装器,发现成功攻击保留了有害与良性请求的区分度,但在回答开始时拒绝表达减弱,这种现象称为安全传递衰减。移除与场景框架相关的激活可以恢复拒绝能力,这些效果与模型在没有角色扮演时拒绝有害请求的内部结构共享。
论文角色扮演越狱安全传递机械可解释性

推荐理由:这篇论文揭示了角色扮演越狱如何绕过AI安全机制,找到了具体的安全防护目标。
原文
精选全部日报登录