7月16日
09:36
09:36官方账号arXiv cs.AI@Michal Štefánik, Philipp Mondorf, Andreas Waldis, Qianying Liu, Chuan Yang, Michal Spiegel, Josef Kuchař, Marek Kadlčík, Adam Vawda-Oomerjee, Chaoran Liu, Simon Frieder, Barbara Plank, Fazl Barez, Pontus Stenetorp
AIMO可解释性挑战赛旨在通过模型内部机制区分前沿数学语言模型的鲁棒推理与虚假推理。比赛基于AI数学奥林匹克(AIMO)问题及Fields Model Initiative资源,提供新发布的奥林匹克级数学推理题及其符号表示。参赛者可访问前沿推理模型及其对抗鲁棒性评估,开发识别鲁棒推理的方法。比赛将创建开放的鲁棒性基准和基线系统,推动数学推理与可解释性研究。
推荐理由:想测试数学推理模型是真会思考还是靠蒙?这个挑战赛提供了新基准和资源,帮你判断模型的鲁棒性。
7月10日
11:23
11:23官方账号arXiv cs.LG@Yann Claes, Pierre Geurts, Vân Anh Huynh-Thu
论文提出一种通过偏依赖约束引导神经网络训练的新方法,使模型对特定特征的响应符合先验知识。在多个回归任务(包括动态系统预测)上的实验表明,该方法训练的模型比无约束模型性能更好且数据效率更高。从约束模型得到的解释与实际用户知识一致,而无约束模型则不然。
推荐理由:这篇论文给了你可解释AI的新思路:用偏依赖约束让模型学得更准,还能确保解释符合常识,尤其适合回归问题。
7月9日
10:11
10:11官方账号arXiv cs.LG@Shreyasvi Natraj, Cyrus Achtari, Felice Gragnano, Andrea Milzi, Marco Valgimigli, Diego Paez-Granados
ECGLight是一个端到端轻量级框架,可在CPU上30秒内将手机拍摄的纸质心电图转化为数字化12导联信号。该框架在21,799份PTB-XL数据集上训练,并在医院ECG-Matrix数据集上验证。在PTB-XL上心梗检测准确率达95.51%(F1=0.9519),在ECG-Matrix上OMI检测准确率达88.89%(F1=0.8862)。框架还集成SHAP可解释性,支持临床诊断。
推荐理由:用手机拍张纸质心电图,ECGLight直接在本地CPU跑30秒就能筛查心梗,准确率95%以上,偏远地区也能用。
7月8日
7月7日
12:12
12:12官方账号arXiv cs.LG@Pedro Henrique da Costa Avelar, Le Ou-Yang, Min Wu, Sophia Tsoka
该论文报道了Pathway Activity Autoencoders(PAA)框架,通过通路约束的架构实现多组学数据集成与可解释性。在乳腺癌数据集上,该方法在生存预测和亚型分类任务中验证了集成多组学数据的正面效果。分析表明,基因、蛋白质和miRNA表达层对最终性能贡献最大。重复性实验显示,dropout可提升模型鲁棒性,但过度正则化会降低预测性能。可视化展示了特征空间的临床相关性。
推荐理由:这篇论文提出了一个能同时处理基因、蛋白质和miRNA数据的可解释深度学习框架,在乳腺癌生存预测上效果不错,适合关注多组学分析和可解释AI的读者。
10:25
03:42
03:42官方账号Anthropic@AnthropicAI
精选
Anthropic在论文中引入J-space,一种能够读取、审计和塑造Claude内部思考过程的方法。该方法可提高模型的可信度和透明度,尤其适用于能力不断增强的AI系统。研究还发现了语言模型与人类思维之间令人惊讶的相似性。论文全文发布于transformer-circuits.pub/2026/workspace。
事件专题

推荐理由:Anthropic这次直接打开了Claude的思维黑箱,能用J-space看它在想什么,还能干预调整,对AI安全来说是个新思路。
03:26
03:26官方一手Anthropic: Transformer Circuits资讯
精选
研究者发现Claude模型内部存在一组可言语化的特权表征,这些表征形成全局工作空间。这些表征仅占模型内部状态的一小部分,但可用于报告、控制和推理。相比之下,模型的大部分处理是自动且不可言语化的。该研究揭示了语言模型内部计算的可解释性结构。
推荐理由:这篇文章发现了Claude模型内部有个‘大脑指挥部’——一小部分它能说出来的表征,其他都是自动在干。挺有意思的视角。
7月2日
6月30日
6月26日
6月23日
12:51
12:51官方账号arXiv cs.LG@Ankur Garg, Ulrich Aïvodji, Samira Ebrahimi Kahou, Vincent Michalski
神经分类树(NCT)通过树状结构编码子组信息,无需子组标注即可将样本路由到“易”或“难”节点,并重用路径作为伪标签迭代优化。在五个基准(含二分类和多分类虚假关联)上,NCT一致隔离少数子组,解释性强,且鲁棒性与最先进方法相当。
推荐理由:这篇论文用树结构搞定模型对少数子组表现差的问题,还能看清子组结构,挺实在的。
6月19日
11:41
11:41官方账号arXiv cs.AI@Joshua Engels, Callum McDougall, Bilal Chughtai, Janos Kramar, Senthoran Rajamanoharan, Cindy Wu, Arthur Conmy, Asic Q Chen, Jean Tarbouriech, Min Ma, Brendan O'Donoghue, João Gabriel Lopes de Oliveira, Rohin Shah, Neel Nanda
71°
论文分析 DiffusionGemma 的推理透明度,将其分解为变量透明度和算法透明度。初始发现 DiffusionGemma 的不透明串行深度是自回归 Gemma 4 的 28.6 倍。但通过可解释的 token 瓶颈映射信息流,可将不透明串行深度降至仅 Gemma 4 的 1.1 倍。算法透明度方面,扩散模型因每步所有 token 可变化而更复杂,研究识别了非时间顺序推理、token 与序列涂抹、中间上下文推理等新现象。可监控性测试表明 DiffusionGemma 与 Gemma 4 水平相当。
事件专题

推荐理由:Google 团队这篇论文解释 DiffusionGemma 的推理黑箱有多大,发现能用 token 瓶颈把深度压到几乎和 Gemma 4 一样,还发现了扩散模型特有的奇怪推理方式。
6月18日
10:57
10:57官方账号arXiv cs.LG@Amiri Hayes, Belinda Li, Jacob Andreas
研究者提出用程序合成方法反向工程Transformer注意力头。他们先计算注意力矩阵,再让预训练语言模型生成Python程序来重现注意力模式。在GPT-2、TinyLlama-1.1B和Llama-3B上,不到1000个程序实现了平均IoU>75%。替换25%的注意力头仅导致16%的困惑度增加,并在下游问答基准上保持性能。
推荐理由:这篇论文用Python程序解释了注意力头怎么工作,还能直接用程序替换掉原始头,精度很高,想看模型内部机制的可以读。
04:01
04:01lmarena.ai@lmarena_ai
Agent Arena 发布了一篇博客介绍其因果追踪方法论,该方法用于分析智能体在竞技场中的行为归因。博客详细解释了如何通过干预模型内部表示来定位影响输出的关键组件。该技术可帮助研究者理解Agent在复杂任务中的决策路径。
推荐理由:想搞懂Agent决策是怎么归因的?Agent Arena这篇博客把因果追踪的方法讲得很清楚,适合做智能体评估的研究者。