18:41官方一手arXiv: DeepSeek@Chuqiao Lin, Shivaji Sondhi, Xiao-Liang Qi稀疏自编码器(SAE)常用于解释大语言模型行为,但区分表面词汇特征与真正高层特征一直困难。研究者提出特征非局域性(FNL),定义为SAE特征激活的逐位置影响熵,可在73%-84%的随机配对中正确区分上下文相关推理特征与词元驱动特征。在越狱缓解审计中,FNL发现多数有效特征实为低FNL的位置特征而非真正识别有害意图。在DeepSeek-R1-Distill-Llama-8B上,引导高FNL特征使MATH-500准确率提升4.6个百分点,优于低FNL特征,但效果因模型而异。论文SAEFNL稀疏自编码器推荐理由:想搞懂SAE特征到底抽没抽到抽象概念?这篇提出FNL指标,不用LLM打分就能测抽象度,还能帮你挑干预特征,实测提分4.6。原文稍后读已读值得跟进有用关注 SAE
18:33官方账号arXiv cs.LG@Nikolai Bolik, Lennart Stöpler, Artur AndrzejakShani等人2026年的研究显示LLM表征能大致还原人类类别边界,但无法捕捉细粒度典型性结构。本文用稀疏自编码器(SAE)活跃潜变量集的重叠度作为更可解释的相似度度量,重新审视该分析。在受控玩具模型中SAE潜变量集能恢复并集式组合结构,在自然文本中也能诱导语义连贯的邻域。但扩展到人类概念分析时,SAE激活集并未比稠密嵌入或残差流状态更忠实还原类别边界或典型性,而是追踪模型内部相似性结构。在受控语义修改下,人类概念变化判断与SAE活跃集变化存在显著不匹配,说明在理想化设置之外SAE特征不按简单词袋语义组合。论文稀疏自编码器SAE可解释性推荐理由:这篇论文用SAE潜变量集做相似度度量,发现它并不比稠密嵌入更贴近人类概念判断,搞可解释性的人值得看看这个反直觉结论。原文稍后读已读值得跟进有用关注 稀疏自编码器
11:38官方账号arXiv cs.LG@Deepanshu Mody, Samarth Agarwal, Utkarsh Mittal, Dipesh Mahato该研究采用Fluent Dreaming/EPO方法(结合GCG token优化和自交叉熵流畅性正则化)在Llama-3.2-3B和Llama-3.1-8B上抑制评估感知潜变量,实现了z≈-7的抑制幅度。发现基于CAA方向的抑制效果与随机方向无异,且在真实评估上下文中抑制该方向无法降低模型的行为评估判断。单个MLP神经元与评估相关但不具因果性。扫描真实Pile数据得到的自然文本基线可与优化器竞争。阳性控制验证了擦除检测器的有效性,解决了此前擦除与旋转的遗留问题。论文Llama-3.2-3BLlama-3.1-8BCAA推荐理由:这篇论文用实验告诉你:看似能隐藏模型“知道自己在被测试”的输入优化,可能是假象——抑制CAA方向跟抑制随机方向没什么两样。原文稍后读已读值得跟进有用关注 Llama-3.2-3B
11:45官方账号arXiv cs.LG@Phu Gia Hoang, Anwoy Chatterjee, Tanmoy Chakraborty, Iryna Gurevych, Subhabrata Dutta稀疏自编码器(SAE)作为可解释性工具,常因特征与模型行为间链接不一致而受限。论文提出特征效应几何分析(FEGA)框架,通过跨上下文移除相同活跃SAE特征并分析logit变化云。发现一致的一维效应罕见,仅有少数特征像可重用方向。将特征分为value-like(静态信息)和pointer-like(上下文相关操作),前者更多表现出结构化低维效应,后者则呈现扩散效应。研究表明,特征虽可解释且有因果关联,但未必提供稳定操控方向。论文SAEFEGA可解释性推荐理由:这篇论文用FEGA方法分析了稀疏自编码器特征的下游几何,发现大多数特征不是单方向,value-like和pointer-like特征效果不同,对理解模型可解释性很有启发。原文稍后读已读值得跟进有用关注 SAE
09:41官方账号arXiv cs.LG@Haoyan Luo, Mateo Espinosa Zarlenga, Mateja Jamnik标准稀疏自编码器(SAE)独立编码每个token,无法捕捉序列中跨时间的持久信息。论文提出的Persistent SAE为每个特征学习一个持久系数,使模型自动决定哪些特征应持久及持续时长。实验表明,该方法在保持与标准SAE竞争性重建质量的同时,学习到从快速到慢速的特征时间尺度谱:快速特征作为局部可解释检测器,慢速特征在持久状态中集中主题级信息。在提示注入监控案例中,慢速特征能在长上下文中保持检测信号并维持因果有效性。论文Persistent Sparse AutoencodersSAE可解释性推荐理由:这篇论文提出了Persistent SAE,让稀疏自编码器学出特征该持久多久,在解释和监控语言模型上更灵活,尤其长文本场景下效果明显。原文稍后读已读值得跟进有用关注 Persistent Sparse Autoencoders
11:11官方账号arXiv cs.LG@Naiyu Yin, Dennis Wei, Tian Gao, Amit Dhurandhar, Karthikeyan Natesan Ramamurthy, Yue Yu论文针对LLM电路学习中原始神经元多义性和SAE特征高维度的计算瓶颈,提出基于稀疏线性回归的CircuitLasso方法。在基准数据上,CircuitLasso恢复电路的结构准确性与最先进的干预方法相当,但计算成本大幅降低。它还能高效揭示SAE特征之间的传播关系,展示可解释语义特征如何影响模型预测。在领域泛化任务中,利用CircuitLasso学到的电路洞见,能以更低成本达到可比性能。论文CircuitLassoLLMSAE推荐理由:这篇论文提出了CircuitLasso,能以更低成本达到和现有方法一样好的电路学习效果,还能揭示可解释的语义特征如何传播。原文稍后读已读值得跟进有用关注 CircuitLasso