论文11:38输入优化抑制大语言模型评估感知潜变量的方法这篇论文用实验告诉你:看似能隐藏模型“知道自己在被测试”的输入优化,可能是假象——抑制CAA方向跟抑制随机方向没什么两样。#Llama-3.2-3B#Llama-3.1-8B#CAA#SAEaarXiv cs.LG@Deepanshu Mody 等 4 人原文稍后读已读值得跟进有用关注 Llama-3.2-3B
论文精选09:46现成人设向量可替代CAA减少模型谄媚行为做AI对齐和模型安全的研究者值得关注——用现成人设向量替代CAA,既减少谄媚又保持准确性,省去标注谄媚数据的麻烦。建议直接看代码和实验细节。#模型对齐#谄媚行为#人设向量#CAAaarXiv cs.AI@Ishaan Kelkar 等 6 人原文稍后读已读值得跟进有用关注 模型对齐