10:56官方账号arXiv cs.LG@Joonas Järve, Halil Ibrahim Aysel, Tarun Khajuria, Meelis Kull本文通过可视化训练过程,使用稀疏自编码器提取候选稀疏特征,研究视觉Transformer(ViT)中特征级别的动态变化。实验表明,特征迁移主要发生在训练早期,且随着特征组织稳定而减少。深层网络比浅层网络更早和更稳定地稳定。论文视觉Transformer特征演变稀疏自编码器推荐理由:这篇论文通过可视化展示了ViT训练过程中的特征演变和迁移,为理解ViT的学习和演变提供了新的视角。原文稍后读已读值得跟进有用关注 视觉Transformer
18:41官方一手arXiv: DeepSeek@Chuqiao Lin, Shivaji Sondhi, Xiao-Liang Qi稀疏自编码器(SAE)常用于解释大语言模型行为,但区分表面词汇特征与真正高层特征一直困难。研究者提出特征非局域性(FNL),定义为SAE特征激活的逐位置影响熵,可在73%-84%的随机配对中正确区分上下文相关推理特征与词元驱动特征。在越狱缓解审计中,FNL发现多数有效特征实为低FNL的位置特征而非真正识别有害意图。在DeepSeek-R1-Distill-Llama-8B上,引导高FNL特征使MATH-500准确率提升4.6个百分点,优于低FNL特征,但效果因模型而异。论文SAEFNL稀疏自编码器推荐理由:想搞懂SAE特征到底抽没抽到抽象概念?这篇提出FNL指标,不用LLM打分就能测抽象度,还能帮你挑干预特征,实测提分4.6。原文稍后读已读值得跟进有用关注 SAE
18:33官方账号arXiv cs.LG@Nikolai Bolik, Lennart Stöpler, Artur AndrzejakShani等人2026年的研究显示LLM表征能大致还原人类类别边界,但无法捕捉细粒度典型性结构。本文用稀疏自编码器(SAE)活跃潜变量集的重叠度作为更可解释的相似度度量,重新审视该分析。在受控玩具模型中SAE潜变量集能恢复并集式组合结构,在自然文本中也能诱导语义连贯的邻域。但扩展到人类概念分析时,SAE激活集并未比稠密嵌入或残差流状态更忠实还原类别边界或典型性,而是追踪模型内部相似性结构。在受控语义修改下,人类概念变化判断与SAE活跃集变化存在显著不匹配,说明在理想化设置之外SAE特征不按简单词袋语义组合。论文稀疏自编码器SAE可解释性推荐理由:这篇论文用SAE潜变量集做相似度度量,发现它并不比稠密嵌入更贴近人类概念判断,搞可解释性的人值得看看这个反直觉结论。原文稍后读已读值得跟进有用关注 稀疏自编码器
11:56官方账号arXiv cs.AI@Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald ClarkMMDiff是一个多模态模型差分框架,通过训练多模态稀疏自编码器(SAE)来发现和控制多模态大模型(MLLM)的内部特征。该框架支持特征隔离、任务特定特征检测和特征级控制三种用途。研究团队在LLaVA-MORE、PaliGemma 2和InternVL3.5三个模型家族上训练了多模态SAE,并在视觉空间理解、多模态安全和OCR任务上进行了评估。移除MMDiff发现的特征可使空间任务性能平均下降12%、OCR下降17%,多模态安全攻击成功率降低24%,且不影响VQA性能。特征引导在空间和OCR任务上分别比标准单层引导基线平均提升+3.6%和+1.8%。论文MMDiff多模态大模型稀疏自编码器推荐理由:想搞懂多模态模型内部怎么运作?MMDiff能找出是哪些特征让模型变聪明,还能精准控制它们,安全性和效果都有数据支撑。原文稍后读已读值得跟进有用关注 MMDiff
10:41官方一手arXiv: DeepSeek@Bo Cheng, Qiaolin Lu, Yi Chang, Yuan Wu该研究用Top-K稀疏自编码器分析DeepSeek-R1-Distill-Qwen-7B在数学题上的中间表征,对比思维链(Thinking)与直接作答(NoThinking)两种模式。结果显示,Thinking模式依赖稀疏高强度特征驱动语言演绎,与题目难度无关;NoThinking模式则呈自适应扩散模式,侧重符号操作。通过抑制激活量最大的三个稀疏特征,发现推理与句法结构紧密耦合,干预会破坏LaTeX和框式答案格式。研究还发现,思维链的连贯性依赖特化特征间的脆弱协调,扰动后出现补偿性过度生成和低信息重复。论文DeepSeek-R1稀疏自编码器思维链推荐理由:想搞懂大模型“思考”和“直接答”到底差在哪?这篇用稀疏自编码器拆解了DeepSeek-R1的推理机制,结论挺反直觉。原文稍后读已读值得跟进有用关注 DeepSeek-R1
12:19官方账号arXiv cs.AI@Arya Labroo, Mengjie Qian, Kate Knill该研究将概念激活向量(CAV)方法扩展至基于BERT的文本评分器和基于Whisper的多模态语音文本评分器,用于检测L2口语评估中因母语或年龄等无关属性产生的偏差。CAV通过激活空间方向表示概念,并用梯度敏感度区分概念是否被编码及是否影响分数。研究发现概念的可恢复性主要取决于模型表示和架构,而非概念本身。稀疏自编码器(SAE)虽使概念更线性可恢复,但会削弱原始激活空间的敏感度,尤其在低维层。论文Concept Activation VectorsBERTWhisper推荐理由:这篇论文教你怎么用CAV和稀疏自编码器查口语评分模型有没有偏袒某类考生,结果发现模型架构影响很大,别光看概念能不能被提取出来。原文稍后读已读值得跟进有用关注 Concept Activation Vectors
11:45官方账号arXiv cs.LG@Phu Gia Hoang, Anwoy Chatterjee, Tanmoy Chakraborty, Iryna Gurevych, Subhabrata Dutta稀疏自编码器(SAE)作为可解释性工具,常因特征与模型行为间链接不一致而受限。论文提出特征效应几何分析(FEGA)框架,通过跨上下文移除相同活跃SAE特征并分析logit变化云。发现一致的一维效应罕见,仅有少数特征像可重用方向。将特征分为value-like(静态信息)和pointer-like(上下文相关操作),前者更多表现出结构化低维效应,后者则呈现扩散效应。研究表明,特征虽可解释且有因果关联,但未必提供稳定操控方向。论文SAEFEGA可解释性推荐理由:这篇论文用FEGA方法分析了稀疏自编码器特征的下游几何,发现大多数特征不是单方向,value-like和pointer-like特征效果不同,对理解模型可解释性很有启发。原文稍后读已读值得跟进有用关注 SAE
13:45官方账号arXiv cs.AI@Haoran Jin, Xiting Wang, Shijie Ren, Hong Xie, Defu Lian稀疏自编码器(SAE)常用于解释大语言模型,但扩展到大规模字典时会出现特征分裂(将连贯概念拆分为非原子潜在变量)和特征吸收(在通用特征中创建任意例外)问题。这些问题源于不同样本间的潜在变量分配不一致。C^2R方法通过惩罚批量中方向相似潜在变量的共激活,显式鼓励每个语义特征由统一潜在变量表示。评估显示C^2R有效缓解分裂和吸收,同时保持重建保真度,代码已在GitHub开源。论文C^2R稀疏自编码器特征分裂推荐理由:这篇论文发现了SAE解释模型时的两个大坑——特征分裂和吸收,然后用C^2R正则化给治好了,代码开源,直接上手试试。原文稍后读已读值得跟进有用关注 C^2R
10:40官方账号arXiv cs.LG@Nathanaël Jacquier, Maria Vakalopoulou, Mahdi S. Hosseini这篇论文提出两种可与Top-k稀疏自编码器架构兼容的稀疏正则化方法:对未选中单元的L1惩罚和尺度不变的L1/L2比率惩罚。在2个数据集、3个视觉基础模型和多种k值下,两种正则化均一致改善单语义性而不降低重构质量。L1/L2惩罚进一步将信息集中到更少潜在单元中,使重构对推理时k的选择更具鲁棒性,并提升小预算线性探测性能。核心发现是硬性架构稀疏性与软性稀疏正则化互补而非互斥。论文Top-k SAE稀疏自编码器可解释性推荐理由:这篇论文给Top-k稀疏自编码器加了两种正则化方法,能让模型更可解释而且重构质量不降,值得做可解释性的人看看。原文稍后读已读值得跟进有用关注 Top-k SAE
12:37官方账号arXiv cs.AI@Gleb Gerasimov, Timofei Rusalev, Nikita Balagansky, Daniil Laptev, Vadim Kurochkin, Daniil Gavrilov精选该研究系统分析了稀疏自编码器(SAE)在不同训练种子下特征的稳定性。研究发现,稳定特征承载了大部分重构和预测相关的信号,而不稳定特征个体不可复现但集中在可复现的低秩子空间中,表明种子依赖性更多反映激活空间内的基模糊性而非纯噪声。通过跨种子聚合独特特征,可以在保持解释方差的同时构建更稳定的SAE。该工作为理解SAE的可靠性提供了新视角。论文稀疏自编码器特征稳定性可解释性推荐理由:做神经网络可解释性研究的团队会关心——SAE特征不稳定不是噪声,而是低维结构的基选择问题,看完能帮你更合理设计实验和解读结果。原文稍后读已读值得跟进有用关注 稀疏自编码器
12:21rohanpaul_ai@rohanpaul_ai精选一篇新论文指出,稀疏自编码器作为LLM控制工具表现不佳的结论可能源于特征标签错误,而非方法本身缺陷。早期研究因标签与模型内部实际因果行为不匹配,导致稀疏自编码器看起来效果差。作者提出监督式管道,通过验证特征活动是否可靠追踪真实数据标签来替换模糊标签,并发现高稀疏性并非必要。尽管提示工程仍更强,但特征控制可直接操纵模型内部机制,为模型行为调控提供新思路。论文稀疏自编码器LLM控制特征标签推荐理由:这篇论文为LLM控制领域拨乱反正——做模型可解释性、安全对齐或行为调控的团队,值得重新审视稀疏自编码器的潜力,建议点开看看如何用标签修正提升控制效果。原文稍后读已读值得跟进有用关注 稀疏自编码器
11:36官方账号arXiv cs.LG@Grégoire Dhimoïla, Victor Boutin, Agustin Martin Picard, Thomas Fel, Thomas Serre精选本文提出一个统一框架,将概念对齐分解为“对齐什么”(表征 vs 概念)和“对齐层级”(实例级 vs 分布级)两个维度,从而定义四种属性。作者发现现有方法常混淆这些属性,优化一个目标并不能可靠恢复其他目标。他们引入 InterVenchA 基准来独立测量提取质量、翻译质量和概念一致性。最后提出 CoSAE(耦合稀疏自编码器),联合强制执行互补的对齐目标,仅需 0.1% 配对数据即可在分布目标锚定下恢复实例级对齐。这项工作表明概念对齐本质上是多目标优化问题,需要明确定义、测量和优化。论文表征对齐概念分解稀疏自编码器推荐理由:做表征对齐、多模态学习或可解释性研究的团队,这篇论文把概念对齐的混乱局面理清了——CoSAE 用极少量配对数据就能实现强对齐,值得直接复现试试。原文稍后读已读值得跟进有用关注 表征对齐
09:30官方账号arXiv cs.AI@Sweta Mahajan, Sukrut Rao, Jiahao Xie, Alexander Koller, Bernt SchieleCLIP等视觉语言模型存在图文嵌入对齐差的问题,因为图像包含的信息远超其标题描述。TEVI框架利用稀疏自编码器解耦图像嵌入,并训练掩码模块根据标题选择性重建嵌入,从而保留标题描述的特征、丢弃无关信息。在合成标题的受控实验中,TEVI能有效保留标题描述的属性。在MS COCO、Flickr、IIW、DOCCI等基准测试中,TEVI提升了检索性能,尤其在长标题任务上增益更明显,同时增强了RoCOCO基准的鲁棒性。论文CLIP稀疏自编码器图文对齐推荐理由:CLIP用户常遇到图文检索不准的痛点,TEVI用稀疏自编码器精准对齐嵌入,做多模态检索或视觉问答的团队可以直接参考其方法改进模型。原文稍后读已读值得跟进有用关注 CLIP
12:05官方账号arXiv cs.LG@William Dorrell稀疏自编码器(SAE)在解析神经网络表征为可解释概念方面取得了成功,但其提取内容的科学结论尚不明确。本文避开传统的数据生成模型,直接研究字典学习最优解必须满足的性质。作者将局部最优性分析扩展到非负联合优化问题,推导出最优SAE特征与其分布之间的约束关系。这些约束解释了SAE的多种行为,包括层次分裂与吸收、残差结构以及密集对跖特征。最后,作者构建了一个新的大字典凸问题,探索了每个数据点对应大量原子的极限情况,为设计下一代SAE提供了理论指导。论文稀疏自编码器可解释性神经网络表征推荐理由:这篇论文为SAE的可解释性提供了理论根基,做可解释AI或模型控制的开发者可以直接参考其结论来设计更可靠的SAE变体。原文稍后读已读值得跟进有用关注 稀疏自编码器
11:14官方账号arXiv cs.LG@Michał Brzozowski, Neo Christopher Chung72°该论文质疑了Archetypal SAEs声称的稳定性优势。研究发现,其稳定性主要源于所有训练运行使用相同的确定性k-means解码器初始化,而非算法本身的约束。作者区分了“稳定性”(独立训练模型间的一致性)和“稳定化”(不同初始化向共同解收敛)两个概念,后者才是可解释性研究真正需要的。当移除共享初始化后,Archetypal约束并未带来额外的稳定化优势。此外,论文还指出预处理依赖的余弦几何问题会干扰终点稳定性指标的解读。研究建议,评估SAE稳定性时应包含轨迹诊断和初始化消融实验。论文稀疏自编码器可解释性稳定性推荐理由:这篇论文戳破了Archetypal SAEs稳定性神话,做可解释性研究的团队需要重新审视自己的评估方法——别被初始化技巧骗了,建议点开看轨迹诊断和消融实验怎么做。原文稍后读已读值得跟进有用关注 稀疏自编码器
10:22官方账号arXiv cs.LG@Elana Simon, Etowah Adams, James Zou稀疏自编码器(SAE)将神经网络激活分解为可解释特征,但许多学习到的特征从未激活,即“特征死亡”问题,浪费字典容量并可能重新引入叠加。不同模型中特征死亡率差异巨大:GPT-2接近零,而AlphaFold3在相同配置下超过70%。研究发现,维度级激活异常值(维度均值远大于逐token变化)通过初始化时基于特征与激活均值的对齐程度改变预激活值,导致与均值反对齐的特征永久获得负预激活而永不激活。研究者形式化了异常严重程度γ=||μ||/||σ||,该指标在454个模型-层组合(涵盖语言、视觉、蛋白质和基因组模型)中预测初始死亡率(TopK的Spearman ρ=0.89,ReLU的ρ=0.82)。死亡特征可在训练中复活,但需要SAE偏置学习激活均值,在高γ下过程极慢。均值中心化(减去激活均值)可绕过此问题,消除所有测试模型中的异常诱导死亡,为预处理步骤的必要性提供了原理基础。论文稀疏自编码器特征死亡激活异常值推荐理由:做可解释性研究或SAE应用的团队,这篇论文直接点出了特征死亡的根因和解决方案——均值中心化就能大幅提升字典利用率,值得在实验中验证。原文稍后读已读值得跟进有用关注 稀疏自编码器
10:30官方账号arXiv cs.AI@Yi Jing, Zao Dai, Jinwu Hu, Zijun Yao, Lei Hou, Juanzi Li, Xiaozhi Wang精选论文提出SAERL框架,利用稀疏自编码器(SAE)提取模型内部信号,用于强化学习(RL)后训练的数据工程。SAERL建模了数据的多样性、难度和质量三个内在属性,分别实现批次多样性控制、易到难课程排序和数据过滤。在Qwen2.5-Math-1.5B上,SAERL相比原始GRPO平均准确率提升3%,训练步数减少20%,且在不同模型规模和RL算法上表现一致。实验表明SAE可跨模型族和规模迁移,是一种轻量可复用的数据工程工具。论文稀疏自编码器数据工程强化学习推荐理由:做LLM后训练数据工程的团队终于有了从模型内部获取信号的方法——SAERL用SAE直接指导数据排序和过滤,比依赖外部信号更高效,做RL训练优化的开发者值得一试。原文稍后读已读值得跟进有用关注 稀疏自编码器
10:54官方账号arXiv cs.LG@David Chanin精选72°一篇来自 arXiv 的论文对 SAEBench(稀疏自编码器标准评估套件)中的质量指标进行了审计,发现 Targeted Probe Perturbation (TPP) 和 Spurious Correlation Removal (SCR) 在标准设置下无法通过多种可靠性测试,不应再用于 SAE 评估。其他指标也存在噪声高、区分度低的问题。sae-probes 变体是测试中最可靠的指标,但仍难以区分同一架构的不同变体。研究结论指出,当前 SAE 领域需要更好的基准测试方法。论文稀疏自编码器可解释性基准测试推荐理由:做可解释性研究的团队会发现,你依赖的 SAE 评估指标可能不可靠——TPP 和 SCR 已被证伪,建议改用 sae-probes 并关注新基准的进展。原文稍后读已读值得跟进有用关注 稀疏自编码器
10:08官方账号arXiv cs.AI@Xinchen Jin, Aditya Chatterjee, Pranav Kumar, Rohan Paleja精选本文提出一种事件锚定的可解释性方法,将稀疏自编码器(SAE)的特征分析与机器人行为事件(如末端执行器关键帧)对齐,而非依赖文本上下文。该方法通过视觉、状态和时间线索聚类任务内的关键帧,将SAE特征与行为事件关联,并可选地通过VLM注释提供语义背景。实验在两种仿真架构和真实机器人上验证,事件锚定排序对OpenVLA产生最强因果效应,并迁移到π₀.5的连续动作块。研究同时指出SAE作为干预基础存在稀疏性和不完美性,干预效果因架构和干预位置而异,激进干预会暴露安全性和可解释性限制。代码已开源。论文稀疏自编码器VLA策略可解释性推荐理由:做机器人VLA策略可解释性的研究者终于有了一个行为锚定的分析框架——事件锚定SAE直接关联动作与行为事件,比纯文本分析更贴近闭环控制,建议做机器人学习或可解释AI的团队点开看看。原文稍后读已读值得跟进有用关注 稀疏自编码器
21:35官方一手Anthropic: Transformer Circuits(资讯)Anthropic 的 Transformer Circuits 团队发布了 2024 年 9 月更新,包含两项小型研究进展。一是对“继任头”(successor heads)的深入调查,探索其在模型中的角色与机制;二是关于稀疏自编码器(SAE)中过采样数据的影响分析。这些更新延续了团队对神经网络可解释性的持续探索,为理解 Transformer 内部运作提供了新视角。对于关注 AI 安全与模型透明度的研究者而言,这些细节有助于改进模型监控与调试方法。论文可解释性Transformer Circuits稀疏自编码器3 个信源在谈事件专题推荐理由:Anthropic 的可解释性团队持续输出硬核研究,做 AI 安全或模型调试的开发者值得跟进——继任头和 SAE 过采样是理解 Transformer 内部机制的关键拼图。原文稍后读已读值得跟进有用关注 可解释性
21:35官方一手Anthropic: Transformer Circuits(资讯)Anthropic 的 Transformer Circuits 团队发布了一篇研究,通过一个玩具模型探讨了 transcoder(一种用于解释神经网络内部表示的稀疏自编码器变体)在什么情况下会变得不忠实。研究发现,当模型需要表示的特征数量超过 transcoder 的容量时,它可能会学习到虚假的、不存在的特征,从而产生误导性的解释。这项工作揭示了当前可解释性方法的一个根本性局限:即使模型看起来工作良好,其内部表示也可能与真实计算过程脱节。这对于依赖这些工具来理解 AI 系统行为的研究者来说是一个重要警示。论文可解释性transcoder稀疏自编码器1 个信源在谈事件专题推荐理由:做 AI 可解释性研究的人会直接受益——这篇论文揭示了 transcoder 可能产生虚假特征的根本原因,看完会对现有方法的可靠性有更清醒的认识。建议所有用稀疏自编码器做模型分析的人点开。原文稍后读已读值得跟进有用关注 可解释性
21:35官方一手Anthropic: Transformer Circuits(资讯)Transformer Circuits 团队发布了 2025 年 10 月的更新,主要涉及视觉特征和字典初始化的改进。在视觉方面,他们改进了特征可视化工具,使得模型内部表示更易理解。字典初始化方面,他们探索了新的初始化方法,以提升稀疏自编码器的训练效率和效果。这些更新对于理解 Transformer 内部机制和提升模型可解释性有重要意义。论文Transformer Circuits可解释性稀疏自编码器推荐理由:对于研究 Transformer 可解释性和稀疏自编码器的开发者,这些更新提供了实用的工具和方法改进,值得关注。原文稍后读已读值得跟进有用关注 Transformer Circuits