论文Agent 与开发者14:49机制研究:语言模型如何检测并定位内部激活扰动给想让 LLM 报告内部状态靠谱一点的人:这篇用 attention head 层面拆解了模型怎么发现和定位被注入的激活扰动。#可解释性#注意力头#LLM#arXivaarXiv cs.AI@Jiahong Zou 等 4 人原文稍后读已读值得跟进有用关注 可解释性
论文19:06Transformer注意力头在表格数据学习中的重要性评分这篇论文提出了Transformer注意力头在表格数据中的重要性评分方法,能帮你优化模型结构并提高效率。#Transformer#注意力头#表格数据#重要性评分aarXiv cs.LG@Ahmad Jad Allah 等 4 人原文稍后读已读值得跟进有用关注 Transformer
论文10:05ROBIN:在Transformer注意力头中定位与修复偏见这篇论文给出了一个白盒方法ROBIN,能精准定位模型中的偏见注意力头并修复,比直接抹掉整个头效果好。#Transformer#ROBIN#WinoBias#注意力头aarXiv cs.LG@Sigma Jahan原文稍后读已读值得跟进有用关注 Transformer
论文精选10:07LOCOS:用分散贡献评分检测非字面检索注意力头这篇论文告诉你怎样用 LOCOS 找出模型里真正干活的注意力头,在长上下文检索任务上效果拔群,比旧方法准很多。#LOCOS#Qwen3#Gemma-3#OLMo-3.1aarXiv cs.LG@Aryo Pradipta Gema 等 3 人原文稍后读已读值得跟进有用关注 LOCOS
论文10:08越狱攻击下鲁棒有害特征:注意力头专业化的机制证据这篇论文用注意力头机制解释了越狱攻击无法完全消除安全特征,还提出一种无需训练的检测方法,效果不输传统对抗训练。#越狱攻击#注意力头#LLM安全#对抗鲁棒性aarXiv cs.AI@Yanchen Yin 等 3 人原文稍后读已读值得跟进有用关注 越狱攻击
论文精选11:13Gaze Heads:视觉语言模型如何注视它们描述的对象操控VLM输出,像翻漫画一样准#VLM#Gaze Heads#注意力头#多模态aarXiv cs.LG@Rohit Gandikota, David Bau原文稍后读已读值得跟进有用关注 VLM
论文精选10:39注意力头电路发现:共激活提出,消融验证做模型可解释性研究的团队会感兴趣——这篇论文把共激活聚类和因果消融结合起来,给出了一个验证注意力头电路的实用方法,建议做电路分析的开发者试试这个闭环流程。#注意力头#电路发现#共激活#因果消融aarXiv cs.AI@Yongzhong Xu原文稍后读已读值得跟进有用关注 注意力头
论文官方一手21:35HeadVis:交互式可视化工具助你理解语言模型注意力头行为做模型可解释性研究或想深入理解 Transformer 内部机制的开发者,HeadVis 提供了一个直观的交互式分析工具,值得一试。#注意力头#可视化工具#模型可解释性#TransformerA官方一手Anthropic: Transformer Circuits原文稍后读已读值得跟进有用关注 注意力头