8月8日
04:00
7月22日
12:07
7月7日
23:48
23:48Julien Chaumond@julien_c
精选72°
Anthropic 与 Neuronpedia 合作,基于 Qwen 开源模型构建了交互式模型可解释性演示。该演示展示了 Anthropic 的 jLens 方法,可直观查看神经元激活模式。用户通过 neuronpedia.org/jlens 即可在浏览器中体验。此次合作将闭源公司的可解释性技术应用到开源模型上。
事件专题

推荐理由:Anthropic 居然拿 Qwen 做了个可解释性演示,还和 Neuronpedia 搞了个在线版,你去试试看神经元怎么工作的。
11:24
7月1日
10:45
10:45官方账号arXiv cs.AI@Zifan Carl Guo, Laura Ruis, Jacob Andreas, Belinda Z. Li
73°
论文发现,用固定反事实解释训练语言模型(LM)时,产生的解释更忠实于当前行为而非训练目标。该现象在谄媚(sycophancy)和拒绝(refusal)等任务中出现。即使同时进行其他后训练目标,解释也能追踪行为偏移。结果表明,固定数据集的反事实解释可作为可扩展的后训练信号。
推荐理由:论文发现,用模型早期检查点的解释训练自己,它给出的解释反而更忠实于当前行为,能追踪行为变化,挺神奇的。
6月23日
10:35
10:35官方账号arXiv cs.LG@Talia Sternberg, Gallil Maimon, Yossi Adi
该论文分析了来自不同模型族和规模的交错语音文本语言模型,发现它们会在中间层隐式转录语音对应的文本词,其中77%的数据中该文本词出现在Top候选词中。随后模型在文本空间预测下一个词,再转回语音域。研究还表明,交错训练数据和文本LM初始化是诱发该行为的关键,且该行为与口语知识能力相关。
推荐理由:这篇论文让你搞懂语音语言模型内部是怎么偷偷把语音转成文本再推理的,分析得很透彻,适合想深入理解多模态模型原理的人。
5月26日
11:48
11:48官方账号arXiv cs.AI@Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech
精选
该研究针对激活预言机(activation oracles)的自然语言输出,探索了6种不确定性量化方法。实验基于6000个样本,发现bootstrap模式频率在Qwen3-8B和Qwen3.6-27B上校准误差最低(ECE 5.7% vs 25.5%),而log-prob基线可作为低成本快速筛选信号。这项工作填补了激活预言机置信度评估的空白,对依赖模型内部解释的AI安全研究有直接意义。
推荐理由:做模型可解释性研究的团队终于有了可靠的置信度评估方法——bootstrap模式频率比传统log-prob校准误差低近5倍,建议做LLM内部机制分析的开发者直接参考论文代码。
5月13日