AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

FNL

共 1 条相关 AI 资讯
8月12日
18:41
18:41官方一手arXiv: DeepSeek@Chuqiao Lin, Shivaji Sondhi, Xiao-Liang Qi
稀疏自编码器(SAE)常用于解释大语言模型行为,但区分表面词汇特征与真正高层特征一直困难。研究者提出特征非局域性(FNL),定义为SAE特征激活的逐位置影响熵,可在73%-84%的随机配对中正确区分上下文相关推理特征与词元驱动特征。在越狱缓解审计中,FNL发现多数有效特征实为低FNL的位置特征而非真正识别有害意图。在DeepSeek-R1-Distill-Llama-8B上,引导高FNL特征使MATH-500准确率提升4.6个百分点,优于低FNL特征,但效果因模型而异。
论文SAEFNL稀疏自编码器

推荐理由:想搞懂SAE特征到底抽没抽到抽象概念?这篇提出FNL指标,不用LLM打分就能测抽象度,还能帮你挑干预特征,实测提分4.6。
原文
精选全部日报登录