04:00lmarena.ai@lmarena_aiAgent Arena 发布了因果追踪方法论的解读文章。因果追踪能定位智能体决策时的关键内部状态。Agent Arena 的这套方法旨在解释智能体为何在竞技场中做出某类选择。论文Agent Arenacausal tracing智能体推荐理由:Agent Arena 把怎么用因果追踪看清智能体行为的方法讲透了,做智能体评估或研究模型机制的人可以看看。原文稍后读已读值得跟进有用关注 Agent Arena
12:07官方账号arXiv cs.LG@Pratinav Seth, Hem Gosalia, Aditya Kasliwal, Vinay Kumar SankarapuCircuitKIT是一个开源库,用于连接机械解释性中的电路发现、评估和下游干预工作流。它提供多种发现算法、声明式接口将结构化数据映射为发现任务、补充诊断以及应用模块。该库通过类型化、可序列化的表示统一了电路分析流程,简化了方法比较。论文和代码已发布于arXiv和GitHub。论文CircuitKIT机械解释性电路发现推荐理由:想分析模型内部?CircuitKIT把发现、评估、干预串成一条线,不用再自己拼凑不同工具了。原文稍后读已读值得跟进有用关注 CircuitKIT
09:12官方账号arXiv cs.LG@Shrestha Datta, Hongfu Liu, Anshuman Chhabra论文提出Weight-Adjusted Gradients方法,通过捕获权重与一阶梯度的交互来估计参数重要性。在GPT-2、Llama-2等模型上,WAG发现仅占0.3%的关键参数,修改它们会导致性能下降超过40%,而现有幅度剪枝准则遗漏了这一失效模式。该方法在混合专家模型分配、参数级遗忘、混合精度量化和知识编辑层选择等四类应用中展示了有效性。实验表明WAG统一了零阶与一阶信息,为分析、调试和控制LLM提供了新工具。论文WAGLLM参数重要性推荐理由:这篇论文提出了WAG方法,能精准定位LLM中那些一旦改动就会崩掉的关键参数,比传统重要性指标更灵敏,还顺手解决了专家分配、遗忘、量化等实际问题。原文稍后读已读值得跟进有用关注 WAG
23:48Julien Chaumond@julien_c精选72°Anthropic 与 Neuronpedia 合作,基于 Qwen 开源模型构建了交互式模型可解释性演示。该演示展示了 Anthropic 的 jLens 方法,可直观查看神经元激活模式。用户通过 neuronpedia.org/jlens 即可在浏览器中体验。此次合作将闭源公司的可解释性技术应用到开源模型上。AI产品AnthropicQwenNeuronpedia10 个信源在谈事件专题推荐理由:Anthropic 居然拿 Qwen 做了个可解释性演示,还和 Neuronpedia 搞了个在线版,你去试试看神经元怎么工作的。原文稍后读已读值得跟进有用关注 Anthropic
12:46官方账号arXiv cs.LG@Ananth Eswar, Pratinav Seth, Utsav Avaiya, Vinay Kumar Sankarapu该论文对五个大型语言模型(LLMs)进行单次神经元行零化审计,测试归因方法能否识别因果重要的神经元行。归因方法在识别可丢弃行方面显著优于激活和幅度基线。通过对比有害与良性信号驱动干预,归因行足以在仇恨和犯罪内容上安装拒绝行为,同时保持良性过度拒绝率较低且不影响语言模型流畅性。高秩稳定性选择器可能因果有效性最低,且拒绝行为存在于冗余子空间中,不同归因方法通过几乎不相交的行集实现拒绝。论文neuron selectorsattribution methodsLLM推荐理由:这篇论文直接检验了神经元归因方法的可靠性,发现高秩稳定的选择器反而可能因果失效,对模型可解释性和安全编辑很有启发。原文稍后读已读值得跟进有用关注 neuron selectors
11:24量子位@克雷西Anthropic在Claude模型中发现了类脑空间结构。移除该结构后,Claude在推理任务上的表现明显退化。这项研究揭示了Claude内部高级认知功能的神经基础。论文ClaudeAnthropicAI安全10 个信源在谈事件专题推荐理由:Anthropic发现Claude内部有个类似意识的模块,一删除模型就傻了,这研究真有意思。原文稍后读已读值得跟进有用关注 Claude
11:11官方账号arXiv cs.LG@Jian Gu, Aldeida Aleti, Chunyang Chen, Hongyu ZhangSemRF(语义参考框架)通过固定锚点将语义测量与残差动态分离,解决语言模型层间解码坐标不一致问题。伪逆绑定实现精确同步,在限制双可逆性下提供稳定语义基坐标和失真边界。该框架定义语义Voronoi图,将每层分配至粗粒度单元,并保留单元内的运动和边距。通过轨迹的曲率衡量知识密度,低曲率表示分段线性可压缩性和较低的语义复杂度。实验在控制接口误差和投影残差下给出理论保证。论文SemRF语言模型残差流推荐理由:这篇论文提出SemRF框架,帮你看清语言模型内部计算如何逐层演变,用Voronoi图定位知识分布,比只看激活值更精确。原文稍后读已读值得跟进有用关注 SemRF
10:45官方账号arXiv cs.AI@Zifan Carl Guo, Laura Ruis, Jacob Andreas, Belinda Z. Li73°论文发现,用固定反事实解释训练语言模型(LM)时,产生的解释更忠实于当前行为而非训练目标。该现象在谄媚(sycophancy)和拒绝(refusal)等任务中出现。即使同时进行其他后训练目标,解释也能追踪行为偏移。结果表明,固定数据集的反事实解释可作为可扩展的后训练信号。论文LMIntrospective Coupling反事实解释推荐理由:论文发现,用模型早期检查点的解释训练自己,它给出的解释反而更忠实于当前行为,能追踪行为变化,挺神奇的。原文稍后读已读值得跟进有用关注 LM
10:35官方账号arXiv cs.LG@Talia Sternberg, Gallil Maimon, Yossi Adi该论文分析了来自不同模型族和规模的交错语音文本语言模型,发现它们会在中间层隐式转录语音对应的文本词,其中77%的数据中该文本词出现在Top候选词中。随后模型在文本空间预测下一个词,再转回语音域。研究还表明,交错训练数据和文本LM初始化是诱发该行为的关键,且该行为与口语知识能力相关。论文Speech Language Models交错训练语音模型推荐理由:这篇论文让你搞懂语音语言模型内部是怎么偷偷把语音转成文本再推理的,分析得很透彻,适合想深入理解多模态模型原理的人。原文稍后读已读值得跟进有用关注 Speech Language Models
11:13官方账号arXiv cs.LG@Rohit Gandikota, David Bau精选论文发现视觉语言模型的LM骨干中存在一组称为gaze heads的注意力头,其注意力会追踪模型当前描述的图像区域。通过仅对top-100个gaze heads(少于全部9%)进行注意力掩码干预,能以83.1%的准确率引导模型描述指定的漫画面板,而随机干预无效。该干预同样适用于自然COCO图像,且机制在2B到32B参数规模及多种VLM架构中复现。该工作展示了通过机制分析实现无需重训的推理时多模态行为操控。论文VLMGaze Heads注意力头推荐理由:操控VLM输出,像翻漫画一样准原文稍后读已读值得跟进有用关注 VLM
11:48官方账号arXiv cs.AI@Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech精选该研究针对激活预言机(activation oracles)的自然语言输出,探索了6种不确定性量化方法。实验基于6000个样本,发现bootstrap模式频率在Qwen3-8B和Qwen3.6-27B上校准误差最低(ECE 5.7% vs 25.5%),而log-prob基线可作为低成本快速筛选信号。这项工作填补了激活预言机置信度评估的空白,对依赖模型内部解释的AI安全研究有直接意义。论文激活预言机置信度校准不确定性量化推荐理由:做模型可解释性研究的团队终于有了可靠的置信度评估方法——bootstrap模式频率比传统log-prob校准误差低近5倍,建议做LLM内部机制分析的开发者直接参考论文代码。原文稍后读已读值得跟进有用关注 激活预言机
11:15官方账号arXiv cs.LG@Lanxin Xiang, Liang Shi, Youhui Ye, Boyu Jiang, Dawei Zhou, Feng Guo精选特征归因分析在解释机器学习模型时,常因数据分割、随机种子等随机因素导致结果不稳定。本文提出 RoSHAP 框架,通过 Bootstrap 重采样和核密度估计建模特征重要性得分的分布,并证明聚合得分渐近服从高斯分布,大幅降低计算成本。RoSHAP 指标同时奖励活跃、强且稳定的特征,在模拟和真实实验中优于单次归因方法。使用 RoSHAP 筛选的特征构建的模型,在预测性能接近全特征模型的同时,显著减少了特征数量。该框架提升了模型的可解释性和稳定性,为可靠的数据驱动决策提供了支持。论文特征归因SHAP鲁棒性推荐理由:做模型可解释性研究的团队终于有了一个能对抗随机波动的归因指标——RoSHAP 通过分布建模让特征排序更稳定,做特征筛选和模型审计的开发者可以直接用。原文稍后读已读值得跟进有用关注 特征归因
21:35官方一手Anthropic: Transformer Circuits(资讯)Transformer Circuits 团队发布了 2025 年 1 月的更新,重点介绍了字典学习(dictionary learning)的多种优化技术。这些技术旨在提高模型可解释性,通过更高效地分解神经网络激活值来理解内部机制。更新包括新的训练技巧、稀疏性控制方法以及计算效率改进,有助于研究人员更深入地分析 transformer 模型的行为。这对于推动 AI 安全性和透明度具有重要意义,尤其适合从事可解释性研究的团队。论文字典学习模型可解释性Transformer Circuits推荐理由:字典学习是理解大模型内部机制的关键工具,这些优化技术能显著提升分析效率。做 AI 可解释性研究的团队值得关注,可以直接参考这些方法改进自己的实验。原文稍后读已读值得跟进有用关注 字典学习
21:35官方一手Anthropic: Transformer Circuits(资讯)Anthropic 团队发布了 HeadVis,一个用于理解语言模型中注意力头行为的交互式可视化工具。该工具通过图形化展示注意力头的激活模式、注意力分布和功能角色,帮助研究人员和开发者更直观地分析模型内部机制。HeadVis 支持实时探索不同层和头的注意力模式,并能与模型输出关联,揭示特定头在生成过程中的作用。这一工具旨在降低模型可解释性的门槛,让更多人能够参与理解 Transformer 架构的内部运作。论文注意力头可视化工具模型可解释性推荐理由:做模型可解释性研究或想深入理解 Transformer 内部机制的开发者,HeadVis 提供了一个直观的交互式分析工具,值得一试。原文稍后读已读值得跟进有用关注 注意力头
11:44官方账号arXiv cs.AI(学术论文)这项研究探测了Gemma 3、Qwen 3、Qwen 2.5和Llama 3.1等12个指令微调模型(参数量从270M到27B),发现模型内部对所选工具的表示是线性的,可以通过激活干预来操控。通过添加两个工具平均激活的差值向量,可以在单轮名称提示上以77-100%的准确率(4B以上模型达93-100%)切换工具选择,并且随后的JSON参数会自动适应新工具的架构。此外,该方法还能提前标记潜在错误:在Gemma 3 12B和27B上,top-1与top-2工具差距最小的查询产生错误调用的概率是差距最大查询的14-21倍。因果效应集中在输出层对应目标工具首标记的行方向上,激活修补将影响定位到中后层少数注意力头。即使在基础模型中,内部状态也能在模型实际生成工具名称之前编码正确的工具选择,这表明预训练阶段已经形成了工具表征,指令微调只是将其连接到输出层。论文工具调用线性表征模型可解释性推荐理由:该研究揭示了语言模型中工具选择的内在线性表征机制,为提升工具调用的可解释性和可控性提供了理论基础,对构建更可靠的智能体系统具有重要启发意义。原文稍后读已读值得跟进有用关注 工具调用