论文精选73°10:47角色扮演越狱中的安全传递机制研究这篇论文揭示了角色扮演越狱如何绕过AI安全机制,找到了具体的安全防护目标。#角色扮演越狱#安全传递#机械可解释性#AI安全aarXiv cs.LG@Md Mokarram Chowdhury 等 3 人原文稍后读已读值得跟进有用关注 角色扮演越狱
论文15:35LLM拒绝机制不对称性:答案释放局部化,拒绝恢复需广泛干预这篇论文用因果干预实验拆解了LLM拒绝机制,发现答案释放和拒绝恢复不对称,对AI安全审计很有参考价值。#LLM#拒绝机制#因果干预#AI安全aarXiv cs.AI@Yiqi Liu 等 5 人原文稍后读已读值得跟进有用关注 LLM