AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

CAA

共 2 条相关 AI 资讯
7月29日
11:38
11:38官方账号arXiv cs.LG@Deepanshu Mody, Samarth Agarwal, Utkarsh Mittal, Dipesh Mahato
该研究采用Fluent Dreaming/EPO方法(结合GCG token优化和自交叉熵流畅性正则化)在Llama-3.2-3B和Llama-3.1-8B上抑制评估感知潜变量,实现了z≈-7的抑制幅度。发现基于CAA方向的抑制效果与随机方向无异,且在真实评估上下文中抑制该方向无法降低模型的行为评估判断。单个MLP神经元与评估相关但不具因果性。扫描真实Pile数据得到的自然文本基线可与优化器竞争。阳性控制验证了擦除检测器的有效性,解决了此前擦除与旋转的遗留问题。
论文Llama-3.2-3BLlama-3.1-8BCAA

推荐理由:这篇论文用实验告诉你:看似能隐藏模型“知道自己在被测试”的输入优化,可能是假象——抑制CAA方向跟抑制随机方向没什么两样。
原文
5月21日
09:46
09:46官方账号arXiv cs.AI@Ishaan Kelkar, Nebras Alam, Vikram Kakaria, Madhur Panwar, Vasu Sharma, Maheep Chaudhary
精选
研究发现,使用现成的“怀疑”或“审视”人设向量,可以将模型的谄媚行为(即盲目同意用户错误观点)减少到CAA(对比激活添加)效果的68%至98%,且不会在用户正确时牺牲准确性。与CAA不同,这些向量并非针对谄媚数据训练,而是来自通用角色扮演。此外,人设向量与谄媚方向在激活空间中几乎正交,表明谄媚更像是一种人设级属性而非单一可操控方向。研究还发现,向“顺从”人设引导并不会镜像增加谄媚。代码已开源。
论文模型对齐谄媚行为人设向量

推荐理由:做AI对齐和模型安全的研究者值得关注——用现成人设向量替代CAA,既减少谄媚又保持准确性,省去标注谄媚数据的麻烦。建议直接看代码和实验细节。
原文
精选全部日报登录