10:03官方账号arXiv cs.LG@Yichen Jiang, Yueqiao Chen, Dongyu LiuConceptTS是一种可解释的预测框架,利用大型语言模型提出相关概念和生成标签规则,将语言模型的领域知识转化为直接监督。该框架将预测组织在命名、可读的概念周围,包含描述历史背景、局部预测区间和完整预测范围的三种互补瓶颈。实验表明,ConceptTS在准确性上与强黑盒基线相当,同时产生具有语义意义的概念激活。论文ConceptTS时间序列预测可解释性推荐理由:ConceptTS利用大型语言模型实现可解释的多变量时间序列预测,提供更直观的预测解释,适合需要理解预测因素的场景。与黑盒基线相比,准确性相当,值得一试。原文稍后读已读值得跟进有用关注 ConceptTS
10:30官方账号arXiv cs.LG@Jun Ni Du, Lukas Adamek, Maxim Kryukov, Flavio Dormont, Ziv Bar-Joseph, Sven Jager, Brandon RufinoBERT-LER模型通过将实验室测试结果编码为离散标记,并使用百分位数分组保留分级信息,结合集成梯度进行基于输入EHR序列的标记级归因,在EHRShot基准套件和哮喘严重程度进展研究中取得了与公开基准模型相媲美的预测性能。该模型在实验室相关任务上往往超过公开基准模型,并提供了与临床已知风险因素一致的归因。论文BERT-LER模型临床预测电子健康记录推荐理由:BERT-LER模型在临床预测任务中表现出色,结合了实验室值表示和可解释性,适用于多个治疗领域和预测任务,值得一看。原文稍后读已读值得跟进有用关注 BERT-LER模型
15:35官方账号arXiv cs.AI@Yiqi Liu, Yang Wang, Songxin Wang, Chenghao Xiao, Chenghua Lin该研究通过受控保留设置,对语言模型拒绝回答时的内部机制进行了因果分析。研究发现,即使模型生成干净拒绝,正确答案仍可从隐藏状态线性恢复。释放被抑制的答案只需单位置补丁,而重新施加抑制则需要跨多个位置的干预。平均答案到拒绝的位移向量不能作为可靠的可逆线性控制开关。这表明拒绝并非简单对称开关,探针可恢复性可能高估真实行为控制能力。论文LLM拒绝机制因果干预推荐理由:这篇论文用因果干预实验拆解了LLM拒绝机制,发现答案释放和拒绝恢复不对称,对AI安全审计很有参考价值。原文稍后读已读值得跟进有用关注 LLM
15:28官方账号arXiv cs.AI@Benjamin Belay该研究探讨语言模型输出能否携带可验证的内部计算证据。在模块化前馈网络和Transformer两种架构上,用算术任务训练模型,使其经过两个离散中间状态。系统在128对匹配测试中全部通过,检测器成功恢复认证内部状态信号。五个前馈模型和三个Transformer模型均复现了因果计算。单独答案实验中,线性探针未能恢复自然学习的中间状态。论文计算溯源可解释性Transformer推荐理由:这篇论文用受控实验证明,模型输出能藏住内部状态的证据,128对测试全过,对理解AI可解释性挺有意思。原文稍后读已读值得跟进有用关注 计算溯源
15:27官方账号arXiv cs.AI@Enric Boix-Adsera, Benedict Tessler研究人员发现AI模型普遍存在一种称为“模型催眠”的现象,其中提示中看似无关的微弱线索可被系统组合以强力控制模型行为。该现象在包括前沿推理模型在内的多种模型家族和规模中均出现,且催眠提示可在模型间转移。由于模型受不明显文本选择(如改写和拼写错误)控制,这为AI安全和可解释性带来新挑战。论文Model HypnosisAI安全可解释性推荐理由:这篇论文揭示了AI模型能被微小文本线索操控,对安全和可解释性影响大,值得关注。原文稍后读已读值得跟进有用关注 Model Hypnosis
10:18官方账号arXiv cs.LG@Jules Soria, Alban Grastien, Romain Xu-Darme, Julien Girard-Satabin, Zakaria Chihani, Daniela CancilaALE框架原先仅支持L2范数下的欧几里得潜在空间。本研究将ALE推广至球面度量、高斯密度和维度投影三类非欧几里得原型架构。作者针对三类变体推导了映射或新型界算法,并在图像分类器上计算子集最小形式解释。该统一框架在三种架构间首次实现严格的可解释性比较。论文ALEL2原型网络推荐理由:ALE以前只支持L2空间,这篇把它扩展到球面、高斯这些新结构,还在图像分类上实测了。原文稍后读已读值得跟进有用关注 ALE
10:16官方账号arXiv cs.LG@Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel MarksCHIVE是一个基于智能体的pipeline,通过反事实提示编辑自动发现并研究LLM在自然场景中的意外行为,生成数千条附带反事实证据的高质量解释。研究人员用它评估多种常见可解释性技术,发现这些技术并未提升代理预测反事实行为的能力。此外,用CHIVE生成的数据训练模型预测反事实结果,能够泛化到多种分布外设置。论文表明CHIVE可自动发现自然发生的LLM行为解释,并为评估和改进解释方法提供新途径。论文CHIVELLM可解释性推荐理由:这篇论文搞了个CHIVE自动找模型意外行为,结果发现现有可解释性技术对预测反事实行为没啥用,但用来训练数据倒挺能泛化,值得做可解释性的人看看。原文稍后读已读值得跟进有用关注 CHIVE
16:32量子位@思邈至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%。该路线无需训练替代网络,数据成本依旧低于1%。它直接通过权重分解来理解模型,数据开销控制在1%以内。AI模型至知研究院可解释性权重拆解推荐理由:至知研究院的新方法拆权重就能解释大模型,数据成本不到1%,比训练替代网络省太多了。原文稍后读已读值得跟进有用关注 至知研究院
11:19官方账号arXiv cs.LG@David Chushig-Muzo, María Ángeles Rodríguez de Cara, Eva Milara, Francisco J. Lara-Abelenda, Luis Zhinin-Vera, Diego H. Peluffo-OrdóñezTabSOM是一种基于自组织映射的表格转图像编码方法,通过颜色匈牙利赋值让每个特征占据固定画布位置。它用SOM组件平面构建捕获特征两两关系的图,并堆叠多尺度节点通道来编码特征值与交互。与十二种现有表格转图像方法在公开二分类数据集上对比,TabSOM在每个数据集上排名第一或第二,且方差最低。其可解释性结果与Random Forest、XGBoost和SHAP验证,类分离分数与基线一致并补充结构信息。论文TabSOMSOM表格转图像推荐理由:做表格分类想用深度学习?TabSOM把表格变成图像,打平十二种老方法还更稳,连特征关系都能可视化,值得试。原文稍后读已读值得跟进有用关注 TabSOM
01:32Fireworks AI@FireworksAI_HQ精选Fireworks AI 将 Anthropic 的 J-Lens 探针部署到开源模型 Kimi K3 和 Qwen 3.5-9B 上。通过检查模型的内部状态,发现它们在生成首个 token 之前就已布置好对应词汇。相关结果发布在 Fireworks 的 J-Lens 研究博客页面。论文J-LensKimi K3Qwen 3.5-9B10 个信源在谈事件专题推荐理由:Fireworks 把 Anthropic 的 J-Lens 探针装到 Kimi K3 和 Qwen 3.5-9B 上,发现模型在蹦出第一个 token 前就把词准备好了。看内部状态搞可解释性,挺有意思。原文稍后读已读值得跟进有用关注 J-Lens
18:01官方账号arXiv cs.AI@AmirHossein Eshghi, Hamid Saadatfar, Seyyed Ali Hoseini, AmirMohsen Eshghi, Siavash Arjomand Bigdel该综述聚焦类激活映射(CAM)这一可解释视觉技术家族,梳理了自2016年首个CAM提出以来的57篇方法论文。文中按归因机制、架构依赖和评估目标构建分类体系,涵盖梯度法、无梯度评分、高分辨率上采样、弱监督定位、Transformer token归因以及基于CLIP、DINO、SAM的方法。综述指出研究趋势正从单层低分辨率类别分数解释转向多层、概率化、token感知和基础模型感知的比较式解释。评估协议仍碎片化,忠实度、定位、鲁棒性、计算成本和人类信任缺乏统一标准。论文CAM类激活映射可解释性推荐理由:想系统搞懂CAM方法演进,这篇57篇论文的综述把梯度法、Transformer归因、CLIP/DINO/SAM时代的新做法都梳理清楚了,还指出了各方法留下的坑。原文稍后读已读值得跟进有用关注 CAM
18:41官方一手arXiv: DeepSeek@Chuqiao Lin, Shivaji Sondhi, Xiao-Liang Qi稀疏自编码器(SAE)常用于解释大语言模型行为,但区分表面词汇特征与真正高层特征一直困难。研究者提出特征非局域性(FNL),定义为SAE特征激活的逐位置影响熵,可在73%-84%的随机配对中正确区分上下文相关推理特征与词元驱动特征。在越狱缓解审计中,FNL发现多数有效特征实为低FNL的位置特征而非真正识别有害意图。在DeepSeek-R1-Distill-Llama-8B上,引导高FNL特征使MATH-500准确率提升4.6个百分点,优于低FNL特征,但效果因模型而异。论文SAEFNL稀疏自编码器推荐理由:想搞懂SAE特征到底抽没抽到抽象概念?这篇提出FNL指标,不用LLM打分就能测抽象度,还能帮你挑干预特征,实测提分4.6。原文稍后读已读值得跟进有用关注 SAE
18:33官方账号arXiv cs.LG@Nikolai Bolik, Lennart Stöpler, Artur AndrzejakShani等人2026年的研究显示LLM表征能大致还原人类类别边界,但无法捕捉细粒度典型性结构。本文用稀疏自编码器(SAE)活跃潜变量集的重叠度作为更可解释的相似度度量,重新审视该分析。在受控玩具模型中SAE潜变量集能恢复并集式组合结构,在自然文本中也能诱导语义连贯的邻域。但扩展到人类概念分析时,SAE激活集并未比稠密嵌入或残差流状态更忠实还原类别边界或典型性,而是追踪模型内部相似性结构。在受控语义修改下,人类概念变化判断与SAE活跃集变化存在显著不匹配,说明在理想化设置之外SAE特征不按简单词袋语义组合。论文稀疏自编码器SAE可解释性推荐理由:这篇论文用SAE潜变量集做相似度度量,发现它并不比稠密嵌入更贴近人类概念判断,搞可解释性的人值得看看这个反直觉结论。原文稍后读已读值得跟进有用关注 稀疏自编码器
17:51官方账号arXiv cs.AI@Rahul Gupta, Abhinav Mohanty, Anaelia Ovalle, Anil Ramakrishna, Anubrata Das, Apurv Verma, Jwala Dhamala, Ninareh Mehrabi, Tharindu Kumarage, Yada Pruksachatkun, Yang Trista Cao, Kai-Wei Chang, Aram GalstyanTrustNLP研讨会自2021年起与ACL系列会议联办,论文数从8篇增至41篇,六届共144篇。综述按六类信任维度分类,发现2025-2026年真实性主题占37%,公平性最稳定,可解释性呈U型回升。与ACL等约2000篇论文对比,TrustNLP主题分布接近领域平均水平。论文TrustNLP可解释性AI安全推荐理由:想快速了解NLP信任研究六年的演变脉络,看这篇综述就够了,它把144篇论文的规律都总结好了。原文稍后读已读值得跟进有用关注 TrustNLP
11:56官方账号arXiv cs.AI@Hunar Batra, Lachin Naghashyar, Ashkan Khakzar, Philip Torr, Christian Schroeder de Witt, Constantin Venhoff, Ronald ClarkMMDiff是一个多模态模型差分框架,通过训练多模态稀疏自编码器(SAE)来发现和控制多模态大模型(MLLM)的内部特征。该框架支持特征隔离、任务特定特征检测和特征级控制三种用途。研究团队在LLaVA-MORE、PaliGemma 2和InternVL3.5三个模型家族上训练了多模态SAE,并在视觉空间理解、多模态安全和OCR任务上进行了评估。移除MMDiff发现的特征可使空间任务性能平均下降12%、OCR下降17%,多模态安全攻击成功率降低24%,且不影响VQA性能。特征引导在空间和OCR任务上分别比标准单层引导基线平均提升+3.6%和+1.8%。论文MMDiff多模态大模型稀疏自编码器推荐理由:想搞懂多模态模型内部怎么运作?MMDiff能找出是哪些特征让模型变聪明,还能精准控制它们,安全性和效果都有数据支撑。原文稍后读已读值得跟进有用关注 MMDiff
23:14Yangyi@Yangyixxxx田渊栋在访谈中称大模型目前仍是黑箱,但终将变成科学。他离开Meta后创立Recursive Superintelligence,用AI实现递归式自我进化。去年8月他与GPT-5合作完成grokking研究,认为模型已强到不再需要实习生。Claude的研究agent累计运行约800小时,追回weak-to-strong 97%的性能差距,而人类研究者一周只追回23%。Jeff Dean于8月5日卸任Google职务,成立公益公司Discovery Loop。行业RSIGPT-5Claude推荐理由:田渊栋聊为什么大模型还不是科学,他创业搞RSI用AI自我进化,还拿Claude研究agent和人类做了对比。原文稍后读已读值得跟进有用关注 RSI
12:21官方账号arXiv cs.AI@Jerzy Stefanowski该论文指出可解释人工智能(XAI)在评估不足方面的局限性,并以DetoxAI图像识别系统为例说明偏见检测与概念遗忘中的问题。论文展示了一种人工地面评估图像分类解释方法的具体案例,并探讨了在概念漂移下适应解释的方法。作者还分享了为概念漂移问题调整反事实解释的经验,并讨论了数据、模型与解释共同演化带来的追踪挑战。该文已收录于IJCAI-ECAI 2026的EASi研讨会论文集,由Springer CCIS第3107卷出版。论文XAIDetoxAI概念漂移推荐理由:XAI评估怎么做才靠谱?这篇论文用DetoxAI和概念漂移案例讲清了不足和应对思路,适合搞模型解释的人读。原文稍后读已读值得跟进有用关注 XAI
11:45官方账号arXiv cs.LG@Abhinav Thorat, Ravi Kumar Kolla, Vishak K Bhat, Harsh Vardhan Singh Chauhan, Niranjan PedanekarGENESIS是一个可解释的混合因果发现框架,将图构建分解为可解释的决策点。它先识别并评分三元结构(链、叉、对撞)作为透明先验,再结合观测证据逐步精化图,仅在统计证据不足时调用领域知识。实验显示,GENESIS在所有设置中实现100%的决策可追溯性,并在多数基准数据集上以结构汉明距离(SHD)优于纯统计方法,性能与最先进的LLM辅助方法相当。论文GENESIS因果发现可解释性推荐理由:这篇论文提出了GENESIS,让因果发现的每条边都能说清是统计证据还是领域知识,还保证100%可追溯,比纯统计方法更准。原文稍后读已读值得跟进有用关注 GENESIS
11:35官方账号arXiv cs.AI@Marco Giunti, Fabrizia Giulia Garavaglia这篇论文重新解释Transformer推理机制,提出SIDPP(序列级交互式动态并行处理)框架。作者用输出-权重互连描述部分网络的输出如何决定其他网络的权重,从而根据输入提示动态生成变换参数。他们发现动态处理的贡献随提示长度增长,可等于或超过静态处理,称为强提示敏感性。论文还推测人类语言处理可能也是类Transformer架构实现的SIDPP。论文TransformerSIDPP动态处理推荐理由:这篇论文把Transformer说成“用概念变换概念”,提出动态权重来自输入的新解释,还猜测人脑可能也这么处理语言。原文稍后读已读值得跟进有用关注 Transformer
11:25官方账号arXiv cs.AI@Michal Mráz, Justin Shenk研究者用对比线性探针在Qwen3-32B的残差流中定位了短期与长期时间视界方向,并用对比激活加和进行定向干预。在保留的二选一时间选择任务上,该方法能诱发大幅且双向的偏好改变。在改变奖励大小和延迟的分布外货币跨期选择任务中,干预显著向两个方向移动了模型在较小更早与较大更晚奖励之间的无差异阈值。适度的时间干预还提升了TravelPlanner规划能力指标。结果表明大型语言模型的跨期偏好可测量且可操控,这对涉及延迟收益与成本的AI建议系统有直接影响。论文Qwen3-32BContrastive Activation Addition时间偏好推荐理由:这篇论文在Qwen3-32B上找到了时间偏好的内部方向,用对比激活加和就能双向改变模型选短期还是长期,还能顺带提升规划能力,挺有意思。原文稍后读已读值得跟进有用关注 Qwen3-32B
09:50官方账号arXiv cs.LG@Abdallah Khemais该论文将激活修补与权重空间消融的一致性分析从单残差块扩展到多层,并精确分离出跨层余项。作者为注意力子块导出了闭式Jacobian界,在Qwen2.5-1.5B-Instruct真实权重上验证,未出现一次违反。他们还在该模型上发现了一个涌现的间接目标识别电路,五个测试实例中三个表现出可测量的非零交互。论文同时补全了前作未展示的曲率常数。论文Qwen2.5-1.5B-Instruct权重空间消融Jacobian界推荐理由:这篇论文把权重空间消融的分析从单层推到了多层,还在Qwen2.5上验证了闭式注意力界,顺手找出了一个涌现电路,挺有意思。原文稍后读已读值得跟进有用关注 Qwen2.5-1.5B-Instruct
10:07官方账号arXiv cs.LG@Antonia Holzapfel, Andres Felipe Posada Moreno, Sebastian TrimpeCENDRe是一种面向CNN时间序列分类器的概念提取方法,自动发现驱动预测的时域和频域模式。它通过两阶段聚类和轮廓系数指导的聚合自动确定概念数量,无需预设。方法利用存在分数的梯度生成时域掩码,并经可逆傅里叶变换映射到频域,实现同一概念的频域定位。在合成基准上,CENDRe的表示正确性与现有方法相当,重要性正确性显著更高。在真实轴承故障数据上,它提取出驱动模型预测的频带,为故障诊断提供时域方法无法给出的证据。论文CENDRe概念提取时间序列推荐理由:这篇论文提出了CENDRe,给时间序列CNN做概念提取,能自动找概念数量,还能同时定位时域和频域,比只看时域的方法更靠谱。原文稍后读已读值得跟进有用关注 CENDRe
09:48官方账号arXiv cs.LG@Christian Oliva, Luis F. Lago-FernándezarXiv 论文提出EPC评分,这是对Explainability-Performance Coefficient的扩展,用模型无关方式量化解释质量,显式平衡特征选择稀疏性与模型性能保持。研究在表格、文本、图像三种模态上做了实证验证,发现EPC能揭示网络激活、数据维度和解释器性能之间的操作依赖。作者将EPC与独立人类解释对比,证明更高EPC评分与人类词汇情感判断及空间视觉注释有强一致性。论文EPC可解释性XAI推荐理由:这篇论文给可解释性打分提出了一个新指标EPC,不挑模型,而且拿人类判断验证过,做XAI研究的可以看。原文稍后读已读值得跟进有用关注 EPC
09:44官方账号arXiv cs.LG@Aleksandr Berdnikov, Yevgeny Liokumovich研究发现,100B参数级别的语言模型在残差流中编码了夜空地图表示,且可从提示“夜空中靠近这个天体的目标是什么”中解码。多数开源模型在该表示上LOO测试显著,解释方差R²达65%-85%,中位角度误差为12°-21°。这是高维弯曲不可约特征流形的首个实例。代码已开源。论文语言模型星空地图可解释性推荐理由:新研究发现大模型脑子里有张星空图,还能解码出来,挺有意思的。原文稍后读已读值得跟进有用关注 语言模型
11:11官方账号arXiv cs.AI@Tereza Kinská, Jan Křetínský, Tobias Meggendorfer, Sabine Rieder, Maximilian WeiningerdtControl2+ε扩展了dtControl2工具,针对马尔可夫决策过程(MDP)中的控制器表示问题。通过引入允许的精度损失参数ε≥0,该工具能生成更小的决策树,同时保证ε-最优性。相比现有最优方法,生成的决策树规模可减少数个数量级,从而提升人机理解释性。方法在保持核心控制逻辑的前提下,可控地省略细节。论文dtControl2决策树MDP推荐理由:想搞懂马尔可夫决策过程控制器可解释性的可以看看这个。dtControl2+ε用ε容忍度换更小更易懂的决策树,比原先的压缩效果好很多。原文稍后读已读值得跟进有用关注 dtControl2
12:27官方账号arXiv cs.AI@Krithi Shailya, Ananya Lakshmi Ravi, Venkatanathan K. V., Sowmya S. Sundaram, Gokul S. Krishnan, Aditi Anand, Balaraman Ravindran研究者提出KANEx框架,首次利用KAN(Kolmogorov-Arnold Networks)的符号透明性来支撑VLM推理,从而生成更可信的文本解释。同时设计了KAN-Map热力图方法,直接从KAN模型导出而非梯度近似。在MIMIC-CXR数据集上,基于KAN的ResNet/ViT架构语义相似性提升,并产生更忠实的显著性图。定位和推理质量比基线提高10%。论文认为将语言解释和视觉归因建立在数学可解释单元上是可信医疗AI的必要步骤。论文KANExKANMIMIC-CXR推荐理由:这篇论文展示了KAN不只是理论上可解释,还能落地到医学影像中,让解释更可靠,比标准ResNet/ViT定位准确率提升10%。原文稍后读已读值得跟进有用关注 KANEx
11:50官方账号arXiv cs.LG@Shaker Al-Tamari, Waled Kadour在倒立摆基准上,TD3教师模型(Twin Delayed DDPG)的策略被蒸馏至浅层决策树学生。通过自定义物理感知特征和噪声Oracle Rollouts生成数据集,学生模型性能与教师相当。控制理论分析显示从连续控制转向离散规则控制导致高频Bang-Bang执行和稳定双模态极限环。BIBO稳定性得到维持,同时提供了全局和局部可解释性。论文TD3可解释性决策树推荐理由:研究者用决策树“拆解”了黑箱TD3,在倒立摆任务上性能不减,还解析了控制规律,适合安全关键AI参考。原文稍后读已读值得跟进有用关注 TD3
11:45官方账号arXiv cs.LG@Phu Gia Hoang, Anwoy Chatterjee, Tanmoy Chakraborty, Iryna Gurevych, Subhabrata Dutta稀疏自编码器(SAE)作为可解释性工具,常因特征与模型行为间链接不一致而受限。论文提出特征效应几何分析(FEGA)框架,通过跨上下文移除相同活跃SAE特征并分析logit变化云。发现一致的一维效应罕见,仅有少数特征像可重用方向。将特征分为value-like(静态信息)和pointer-like(上下文相关操作),前者更多表现出结构化低维效应,后者则呈现扩散效应。研究表明,特征虽可解释且有因果关联,但未必提供稳定操控方向。论文SAEFEGA可解释性推荐理由:这篇论文用FEGA方法分析了稀疏自编码器特征的下游几何,发现大多数特征不是单方向,value-like和pointer-like特征效果不同,对理解模型可解释性很有启发。原文稍后读已读值得跟进有用关注 SAE
11:35官方一手arXiv: DeepSeek@Dhruvil S, Fenil Sojitra, Ravirajsinh Chauhan精选论文首次对DeepSeek-V2引入的多头潜在注意力(MLA)进行全面的可解释性分析。研究者训练了一个114M参数的Transformer,在TinyStories上微调后通过SVD、线性探针等方法发现:共享低秩瓶颈cKV保留了98%的实体身份信息,几乎完全丢弃位置信息,实现了81%的KV缓存压缩。归纳头集中在第12层,而标准多头注意力中它们分布在不同层。瓶颈平均仅使用46%的容量,存在过度配置。这些结果揭示了MLA并非被动压缩,而是主动重塑了模型的内容组织、位置编码和电路结构。论文MLADeepSeek-V2可解释性推荐理由:想看MLA到底怎么工作的?这篇论文用114M模型做实验,发现cKV只记内容不记位置,还能省81%缓存,归纳头也全挤在一层,挺有意思的。原文稍后读已读值得跟进有用关注 MLA
10:59官方账号arXiv cs.LG@Athanasios Papastathopoulos-Katsaros, Steven T. Lee, Lin Yao, Ajay Thomas, Junseok Park, Matthew J. McGinley, Zhandong Liu论文提出bag-of-waves框架,利用移位不变k-means无监督学习EEG波形模板(原子),将连续信号转为原子序列计数进行分类。方法扩展了原子间转移n-gram和跨通道空间原子。在三个数据集测试:仅16只小鼠的单通道基因型聚类、静息态痴呆分类、以及TUEV临床EEG六分类基准。性能与深度/基础模型相当,但参数量极少且完全可解释——每个原子对应可检验的波形形态,神经生理学家可验证已知临床特征。论文bag-of-wavesEEG可解释性推荐理由:这篇论文用了一种叫bag-of-waves的巧办法,只需少量数据就能从脑电信号里学到可解释的波形模板,比那些黑箱深度模型好懂,还省钱省算力。原文稍后读已读值得跟进有用关注 bag-of-waves
10:57官方账号arXiv cs.LG@Ahmed M. Abuzuraiq, Philippe Pasquier论文提出一种面向创意实践的可解释AI方法,让艺术家能检查、修改和调试扩散模型内部结构。作者在ComfyUI的节点工作流中集成了交互式层选择与干预控件,实现模型弯曲。通过对Stable Diffusion 1.5进行定性与定量分析,发现操纵不同组件(如UNet层)会产生相对一致的视觉效应。该方法帮助艺术家建立层级的直觉,理解模型各部分如何影响生成图像。论文Stable DiffusionComfyUI扩散模型推荐理由:这篇论文告诉你,艺术家也能像玩材料一样玩扩散模型内部。他们在ComfyUI做了交互工具,能直接操纵Stable Diffusion的层,看到具体变化。不是理论说教,是真能动手调的。原文稍后读已读值得跟进有用关注 Stable Diffusion
10:06Ethan Mollick@emollickClaude近期似乎停止向用户展示完整的总结性思考轨迹(summarized thinking traces)。作者Ethan Mollick对比了前后变化。他认为这损失了可解释性,因为查看轨迹有助于诊断模型错误。此外这些轨迹本身也具有启发性。AI产品ClaudeAnthropic思维链10 个信源在谈事件专题推荐理由:Claude用户注意了,Claude不再显示完整思考过程,这对理解模型行为影响很大。原文稍后读已读值得跟进有用关注 Claude
12:04官方账号arXiv cs.LG@Hongnan Ma, Yiwei Shi, Mengyue Yang, Weiru LiuTimePNS框架解决了现有充分性导向方法可能将无关子序列误判为重要的问题,该框架采用两阶段设计:阶段I学习因果生成过程和充分性掩码;阶段II通过反事实干预评估时间因子的必要性,并以此监督时间门细化解释。在合成和真实时间序列基准上的实验表明,TimePNS能更准确地识别决策关键子序列,并在充分性-必要性权衡上持续优于强基线方法。论文TimePNS时间序列可解释性推荐理由:时间序列分类的黑盒解释往往只找够用的特征,但可能抓到噪音。这篇论文提出了TimePNS,用反事实推理揪出真正必要的子序列,实验效果比现有方法好。原文稍后读已读值得跟进有用关注 TimePNS
11:33官方账号arXiv cs.LG@Cande Lian, Wentao Zeng, Jiabin Wu, Yiming Bie, Wei ZhouFGDSE是一种特征驱动的动态堆叠集成框架,用于预测电动车充电桩在1-30天内的每日故障风险。该框架将信号分为四个特征家族,分别由领域专家模型处理,并加入两个深度时序专家捕捉短期波动和长期退化。在13个站点25个月的数据测试中,FGDSE在10天后超越12个基线,30天宏观召回率约85%,AUC仅下降3.2点。框架揭示极端热是唯一随时间因果效应增强的气候因素,并识别出约30%的站点为热敏感,为气候适应性维护提供量化阈值。论文FGDSEEV充电故障预测推荐理由:这篇论文提出的FGDSE框架能提前30天预测充电桩故障,特别指出极端热是关键风险,帮你搞清楚该什么时候维护。原文稍后读已读值得跟进有用关注 FGDSE
12:22官方账号arXiv cs.AI@Hiskias Dingeto论文指出自然语言自编码器通过重构分数评估解释的忠实性存在缺陷:在Qwen-2.5-7B的口语化器上,约2%的特定主张与重构相关,分数主要反映大意而非具体事实。在合成真值下,标准方法在5/5次运行中产生了共适应私有代码(重构依赖的虚假措辞)。提出两个审计协议(grounded-vs-true交叉和评估器交换)以及RECAP(通过协训练辅助预测器使指定内容可解码)。在RECAP训练的沙盒模型上,新口语化器真实陈述指定内容,代码消失,代价仅+0.001 nat。在预训练的Pythia-160M上,指定内容变得可探针解码,虽新口语化器仅部分传达(真值0.44-0.46 vs 近零对照)。独立探针对口语化器的真实主张评分高于虚假(AUC 0.96 vs 无RECAP 0.82),对抗攻击下RECAP探针仍能识别谎言(AUC 0.95),对照探针降至0.51。论文Qwen-2.5-7BPythia-160M可解释性推荐理由:这篇论文揭露了AI解释性评估的漏洞,并给出了RECAP方法,让你知道如何让模型内部信息真正可验证,而非被花言巧语欺骗。原文稍后读已读值得跟进有用关注 Qwen-2.5-7B
09:41官方账号arXiv cs.LG@Haoyan Luo, Mateo Espinosa Zarlenga, Mateja Jamnik标准稀疏自编码器(SAE)独立编码每个token,无法捕捉序列中跨时间的持久信息。论文提出的Persistent SAE为每个特征学习一个持久系数,使模型自动决定哪些特征应持久及持续时长。实验表明,该方法在保持与标准SAE竞争性重建质量的同时,学习到从快速到慢速的特征时间尺度谱:快速特征作为局部可解释检测器,慢速特征在持久状态中集中主题级信息。在提示注入监控案例中,慢速特征能在长上下文中保持检测信号并维持因果有效性。论文Persistent Sparse AutoencodersSAE可解释性推荐理由:这篇论文提出了Persistent SAE,让稀疏自编码器学出特征该持久多久,在解释和监控语言模型上更灵活,尤其长文本场景下效果明显。原文稍后读已读值得跟进有用关注 Persistent Sparse Autoencoders
09:36官方账号arXiv cs.LG@Afiq Abdillah Effiezal Aswadi, Haotong Ma, Susan Wei贝叶斯滤波变压器(BFT)是一种在两阶段生成序列上训练的 Transformer:先由先验抽取潜在任务,再根据该任务生成观测。在理想极限下,BFT 的下一词预测等于贝叶斯后验预测分布(PPD),但实际训练仅逼近该分布。论文提出预测蒙特卡洛(PMC)方法作为可解释性工具,仅利用下一词生成即可近似 BFT 内部隐含的先验和后验分布。PMC 被应用于三个任务族(0-Markov 和 1-Markov 可交换性),揭示了此前在预测空间观察到的现象在隐空间中依然存在。论文BFTPMC可解释性推荐理由:这篇论文提出了PMC方法,能直接看穿BFT模型内部认为的贝叶斯先验是什么,比传统对比法更靠谱。做可解释性研究的朋友可以试试。原文稍后读已读值得跟进有用关注 BFT
01:09elvis@omarsar074°Anthropic发布arXiv论文(2607.15495),提出LLM中的全局工作空间假说。该假说认为模型能用语言表达的表征像一个带宽受限的共享通道,将少量特征广播到网络其余部分。这为chain-of-thought和steering向量提供了机械论解释:当verbalized reasoning(语言化推理)真正承载负载时,它如何影响后续输出;而当它只是事后叙述时又是什么机制。论文基于Anthropic的J-space研究,将推理过程与神经网络的内部表征联系。论文Anthropic思维链steering vectors1 个信源在谈事件专题推荐理由:Anthropic这篇论文把思维链和steering向量的工作机制讲透了,告诉你什么时候推理是真起作用,什么时候只是马后炮。搞可解释和推理的都该看看。原文稍后读已读值得跟进有用关注 Anthropic
09:30官方账号arXiv cs.AI@Andrea Ferrario该论文提出一种轻量级方法,用于AI治理中的可审计可信度水平评估。方法包括两个组件:基于上下文敏感协议的形式化框架,通过可解释规则(如决策树)学习可信度水平;以及面向合规的生命周期治理流程,涵盖设计标注、部署监控、重新评估与报告。在合成AI生命周期轨迹上验证了方法,涉及退化、冲击、更新等场景。方法不取代法律判断,而是为AI治理相关变化提供证据基础。论文AI治理可信度生命周期推荐理由:这篇论文给出了AI系统生命周期可信度评估的具体方法,用决策树生成可读的规则和阈值,适合做治理合规的工程师看看。原文稍后读已读值得跟进有用关注 AI治理
10:05官方账号arXiv cs.AI@Madhumitha Venkatesan, Shicheng Wen, Jiajing Guo, Jorge Piazentin Ono, Liu Ren, Dongyu LiuPlover是一种以计划为中心的视觉GUI自动化系统。它通过规划-执行架构将任务计划外化为可检查、可修改的工件。在六名参与者的形成性研究基础上,Plover支持自然语言指导和截图干预。实验表明,许多自主GUI智能体的失败可通过可见计划和局部干预进行结构性修复。论文PloverGUI自动化智能体推荐理由:想了解怎么让GUI智能体更可控?这篇论文讲了Plover系统,能把内部计划展示出来让你改,实验证明能修好很多翻车案例,比黑箱靠谱多了。原文稍后读已读值得跟进有用关注 Plover