8月24日
10:03
10:03官方账号arXiv cs.LG@Yichen Jiang, Yueqiao Chen, Dongyu Liu
ConceptTS是一种可解释的预测框架,利用大型语言模型提出相关概念和生成标签规则,将语言模型的领域知识转化为直接监督。该框架将预测组织在命名、可读的概念周围,包含描述历史背景、局部预测区间和完整预测范围的三种互补瓶颈。实验表明,ConceptTS在准确性上与强黑盒基线相当,同时产生具有语义意义的概念激活。
推荐理由:ConceptTS利用大型语言模型实现可解释的多变量时间序列预测,提供更直观的预测解释,适合需要理解预测因素的场景。与黑盒基线相比,准确性相当,值得一试。
8月21日
10:30
10:30官方账号arXiv cs.LG@Jun Ni Du, Lukas Adamek, Maxim Kryukov, Flavio Dormont, Ziv Bar-Joseph, Sven Jager, Brandon Rufino
BERT-LER模型通过将实验室测试结果编码为离散标记,并使用百分位数分组保留分级信息,结合集成梯度进行基于输入EHR序列的标记级归因,在EHRShot基准套件和哮喘严重程度进展研究中取得了与公开基准模型相媲美的预测性能。该模型在实验室相关任务上往往超过公开基准模型,并提供了与临床已知风险因素一致的归因。
推荐理由:BERT-LER模型在临床预测任务中表现出色,结合了实验室值表示和可解释性,适用于多个治疗领域和预测任务,值得一看。
8月18日
10:18
10:18官方账号arXiv cs.LG@Jules Soria, Alban Grastien, Romain Xu-Darme, Julien Girard-Satabin, Zakaria Chihani, Daniela Cancila
ALE框架原先仅支持L2范数下的欧几里得潜在空间。本研究将ALE推广至球面度量、高斯密度和维度投影三类非欧几里得原型架构。作者针对三类变体推导了映射或新型界算法,并在图像分类器上计算子集最小形式解释。该统一框架在三种架构间首次实现严格的可解释性比较。
推荐理由:ALE以前只支持L2空间,这篇把它扩展到球面、高斯这些新结构,还在图像分类上实测了。
8月15日
16:32
8月14日
11:19
11:19官方账号arXiv cs.LG@David Chushig-Muzo, María Ángeles Rodríguez de Cara, Eva Milara, Francisco J. Lara-Abelenda, Luis Zhinin-Vera, Diego H. Peluffo-Ordóñez
TabSOM是一种基于自组织映射的表格转图像编码方法,通过颜色匈牙利赋值让每个特征占据固定画布位置。它用SOM组件平面构建捕获特征两两关系的图,并堆叠多尺度节点通道来编码特征值与交互。与十二种现有表格转图像方法在公开二分类数据集上对比,TabSOM在每个数据集上排名第一或第二,且方差最低。其可解释性结果与Random Forest、XGBoost和SHAP验证,类分离分数与基线一致并补充结构信息。
推荐理由:做表格分类想用深度学习?TabSOM把表格变成图像,打平十二种老方法还更稳,连特征关系都能可视化,值得试。
01:32
01:32Fireworks AI@FireworksAI_HQ
精选
Fireworks AI 将 Anthropic 的 J-Lens 探针部署到开源模型 Kimi K3 和 Qwen 3.5-9B 上。通过检查模型的内部状态,发现它们在生成首个 token 之前就已布置好对应词汇。相关结果发布在 Fireworks 的 J-Lens 研究博客页面。
事件专题

推荐理由:Fireworks 把 Anthropic 的 J-Lens 探针装到 Kimi K3 和 Qwen 3.5-9B 上,发现模型在蹦出第一个 token 前就把词准备好了。看内部状态搞可解释性,挺有意思。
8月12日
17:51
17:51官方账号arXiv cs.AI@Rahul Gupta, Abhinav Mohanty, Anaelia Ovalle, Anil Ramakrishna, Anubrata Das, Apurv Verma, Jwala Dhamala, Ninareh Mehrabi, Tharindu Kumarage, Yada Pruksachatkun, Yang Trista Cao, Kai-Wei Chang, Aram Galstyan
TrustNLP研讨会自2021年起与ACL系列会议联办,论文数从8篇增至41篇,六届共144篇。综述按六类信任维度分类,发现2025-2026年真实性主题占37%,公平性最稳定,可解释性呈U型回升。与ACL等约2000篇论文对比,TrustNLP主题分布接近领域平均水平。
推荐理由:想快速了解NLP信任研究六年的演变脉络,看这篇综述就够了,它把144篇论文的规律都总结好了。
8月5日
11:45
11:45官方账号arXiv cs.LG@Abhinav Thorat, Ravi Kumar Kolla, Vishak K Bhat, Harsh Vardhan Singh Chauhan, Niranjan Pedanekar
GENESIS是一个可解释的混合因果发现框架,将图构建分解为可解释的决策点。它先识别并评分三元结构(链、叉、对撞)作为透明先验,再结合观测证据逐步精化图,仅在统计证据不足时调用领域知识。实验显示,GENESIS在所有设置中实现100%的决策可追溯性,并在多数基准数据集上以结构汉明距离(SHD)优于纯统计方法,性能与最先进的LLM辅助方法相当。
推荐理由:这篇论文提出了GENESIS,让因果发现的每条边都能说清是统计证据还是领域知识,还保证100%可追溯,比纯统计方法更准。
8月3日
7月29日
11:11
11:11官方账号arXiv cs.AI@Tereza Kinská, Jan Křetínský, Tobias Meggendorfer, Sabine Rieder, Maximilian Weininger
dtControl2+ε扩展了dtControl2工具,针对马尔可夫决策过程(MDP)中的控制器表示问题。通过引入允许的精度损失参数ε≥0,该工具能生成更小的决策树,同时保证ε-最优性。相比现有最优方法,生成的决策树规模可减少数个数量级,从而提升人机理解释性。方法在保持核心控制逻辑的前提下,可控地省略细节。
推荐理由:想搞懂马尔可夫决策过程控制器可解释性的可以看看这个。dtControl2+ε用ε容忍度换更小更易懂的决策树,比原先的压缩效果好很多。
7月28日
12:27
12:27官方账号arXiv cs.AI@Krithi Shailya, Ananya Lakshmi Ravi, Venkatanathan K. V., Sowmya S. Sundaram, Gokul S. Krishnan, Aditi Anand, Balaraman Ravindran
研究者提出KANEx框架,首次利用KAN(Kolmogorov-Arnold Networks)的符号透明性来支撑VLM推理,从而生成更可信的文本解释。同时设计了KAN-Map热力图方法,直接从KAN模型导出而非梯度近似。在MIMIC-CXR数据集上,基于KAN的ResNet/ViT架构语义相似性提升,并产生更忠实的显著性图。定位和推理质量比基线提高10%。论文认为将语言解释和视觉归因建立在数学可解释单元上是可信医疗AI的必要步骤。
推荐理由:这篇论文展示了KAN不只是理论上可解释,还能落地到医学影像中,让解释更可靠,比标准ResNet/ViT定位准确率提升10%。
7月27日
10:59
10:59官方账号arXiv cs.LG@Athanasios Papastathopoulos-Katsaros, Steven T. Lee, Lin Yao, Ajay Thomas, Junseok Park, Matthew J. McGinley, Zhandong Liu
论文提出bag-of-waves框架,利用移位不变k-means无监督学习EEG波形模板(原子),将连续信号转为原子序列计数进行分类。方法扩展了原子间转移n-gram和跨通道空间原子。在三个数据集测试:仅16只小鼠的单通道基因型聚类、静息态痴呆分类、以及TUEV临床EEG六分类基准。性能与深度/基础模型相当,但参数量极少且完全可解释——每个原子对应可检验的波形形态,神经生理学家可验证已知临床特征。
推荐理由:这篇论文用了一种叫bag-of-waves的巧办法,只需少量数据就能从脑电信号里学到可解释的波形模板,比那些黑箱深度模型好懂,还省钱省算力。
10:57
10:57官方账号arXiv cs.LG@Ahmed M. Abuzuraiq, Philippe Pasquier
论文提出一种面向创意实践的可解释AI方法,让艺术家能检查、修改和调试扩散模型内部结构。作者在ComfyUI的节点工作流中集成了交互式层选择与干预控件,实现模型弯曲。通过对Stable Diffusion 1.5进行定性与定量分析,发现操纵不同组件(如UNet层)会产生相对一致的视觉效应。该方法帮助艺术家建立层级的直觉,理解模型各部分如何影响生成图像。
推荐理由:这篇论文告诉你,艺术家也能像玩材料一样玩扩散模型内部。他们在ComfyUI做了交互工具,能直接操纵Stable Diffusion的层,看到具体变化。不是理论说教,是真能动手调的。
7月25日
7月24日
12:04
12:04官方账号arXiv cs.LG@Hongnan Ma, Yiwei Shi, Mengyue Yang, Weiru Liu
TimePNS框架解决了现有充分性导向方法可能将无关子序列误判为重要的问题,该框架采用两阶段设计:阶段I学习因果生成过程和充分性掩码;阶段II通过反事实干预评估时间因子的必要性,并以此监督时间门细化解释。在合成和真实时间序列基准上的实验表明,TimePNS能更准确地识别决策关键子序列,并在充分性-必要性权衡上持续优于强基线方法。
推荐理由:时间序列分类的黑盒解释往往只找够用的特征,但可能抓到噪音。这篇论文提出了TimePNS,用反事实推理揪出真正必要的子序列,实验效果比现有方法好。
7月21日
7月17日
10:05
10:05官方账号arXiv cs.AI@Madhumitha Venkatesan, Shicheng Wen, Jiajing Guo, Jorge Piazentin Ono, Liu Ren, Dongyu Liu
Plover是一种以计划为中心的视觉GUI自动化系统。它通过规划-执行架构将任务计划外化为可检查、可修改的工件。在六名参与者的形成性研究基础上,Plover支持自然语言指导和截图干预。实验表明,许多自主GUI智能体的失败可通过可见计划和局部干预进行结构性修复。
推荐理由:想了解怎么让GUI智能体更可控?这篇论文讲了Plover系统,能把内部计划展示出来让你改,实验证明能修好很多翻车案例,比黑箱靠谱多了。