18:23官方账号arXiv cs.LG@Pavel Averin, Theodoros Moysiadis, Ioannis Katakis该综述系统梳理了约束因果发现中的条件独立性检验方法,涵盖PC和FCI算法中骨架剪枝与方向判定的核心环节。文章将CI测试分为偏相关、列联表、回归、最近邻、核和机器学习六大家族,并重点分析各族的鲁棒性局限。综述指出CI检验的统计功效随条件集规模增大而衰减,且I型/II型错误不对称会影响图级骨架恢复和v结构定向。文章还比较了主要R和Python库的采用情况,并总结了混合类型数据、小样本误差控制等开放挑战。论文条件独立性检验因果发现PC算法推荐理由:做因果发现的朋友可以看看,这篇把PC和FCI背后的CI检验方法按六个家族梳理清楚了,还讲了每种方法什么时候会失效,省得自己踩坑。原文稍后读已读值得跟进有用关注 条件独立性检验
11:45官方账号arXiv cs.LG@Abhinav Thorat, Ravi Kumar Kolla, Vishak K Bhat, Harsh Vardhan Singh Chauhan, Niranjan PedanekarGENESIS是一个可解释的混合因果发现框架,将图构建分解为可解释的决策点。它先识别并评分三元结构(链、叉、对撞)作为透明先验,再结合观测证据逐步精化图,仅在统计证据不足时调用领域知识。实验显示,GENESIS在所有设置中实现100%的决策可追溯性,并在多数基准数据集上以结构汉明距离(SHD)优于纯统计方法,性能与最先进的LLM辅助方法相当。论文GENESIS因果发现可解释性推荐理由:这篇论文提出了GENESIS,让因果发现的每条边都能说清是统计证据还是领域知识,还保证100%可追溯,比纯统计方法更准。原文稍后读已读值得跟进有用关注 GENESIS
11:51官方账号arXiv cs.LG@Mohammad FesangharyCausal-TS 是一个开源 Python 库,专为高维和非平稳多变量时间序列的因果发现设计。它提供了四种专用算法 CDNOTS、CDNOTS+、CEDAR 和 GRACE,并集成了 GES、Granger、LASSO-VAR 和 LGES 等现有方法的包装器。所有算法共享一个基于 PyTorch 的 GPU 加速条件独立性测试层。库中还包含一个体制发现管道,通过可插拔的变点检测器识别结构断点,并对每个体制独立运行因果发现。Causal-TS 支持 Python 3.10 至 3.12,可通过 pip 安装,并可选集成 DoWhy 进行因果效应估计。论文Causal-TS时间序列因果发现推荐理由:Bloomberg 开源了 Causal-TS,专门处理高维、非平稳时间序列的因果发现,比通用库多了专用算法和 GPU 加速,还有断点检测功能,做时序因果分析可以试试。原文稍后读已读值得跟进有用关注 Causal-TS
12:07官方账号arXiv cs.LG@Bijan Mazaheri, Jiaqi Zhang, Caroline Uhler该论文针对因果发现中传统忠实性假设(faithfulness)导致错误移除真实因果依赖的问题,提出干预-即时忠实性(intervention-immediacy faithfulness)这一更温和的假设。该假设允许因果路径相互抵消,仅利用硬干预(hard interventions)即可非参数地识别因果结构。实验表明,相比依赖条件独立性检验的两阶段方法,干预信息能更可靠地判断因果链接的存在与否。论文还给出了当干预范围不足时识别条件的等价类。论文因果发现干预忠实性假设推荐理由:这篇论文换了个思路:别死磕条件独立性检验,用干预信息直接做因果发现,还放宽了忠实性假设,挺颠覆的。原文稍后读已读值得跟进有用关注 因果发现
12:50官方账号arXiv cs.LG@Yujia Zheng, Vishal Verma, Mantej Gill, Haoyue Dai, Peter Spirtes, Kun Zhang该论文指出将大语言模型(LLMs)与因果发现结合时,若让模型直接推断因果关系,可能引入文本关联、提示伪影和幻觉机制等不可靠因素。作者主张代理(agents)的角色应局限于检查数据、检索上下文、解释方法假设和澄清图输出,而非提供边、方向、先验或因果结论。他们提出了causal-learn+在线平台,该平台围绕causal-learn算法生态系统协调数据分析、预处理、方法推荐、专家知识融入和形式化发现。在Big Five人格数据案例研究中,展示了代理辅助的因果发现流程,避免将语言模型的不可靠性转化为因果证据。论文causal-learn+LLM因果发现推荐理由:这篇论文给了一个清晰的边界:AI代理该帮什么、不该帮什么。causal-learn+平台演示了如何让LLM辅助分析数据,但不越界做因果推断。原文稍后读已读值得跟进有用关注 causal-learn+
10:22官方账号arXiv cs.LG@Eric V. StroblBLITZ 是一种非参数条件独立性检验方法,可在不到一秒内完成单次测试,适用于因果发现算法中数千次查询的场景。它首先通过低阶多项式回归移除对条件集的平滑依赖,再用浅层树回归对小规模非线性特征图进行残差化。理论分析表明,两阶段设计减少了树回归的有效复杂度,从而控制残差条件均值偏差并避免过拟合。模拟中,BLITZ 比快速核方法、随机特征方法和回归方法等竞争对手提供更好的零分布校准,同时保持最快速度之一。在合成图和流式细胞术数据的因果发现实验中,BLITZ 产生更可靠的端点定向结果和稳健的结构恢复。AI模型BLITZ因果发现条件独立性检验推荐理由:想快速做条件独立性检验?BLITZ 能在一秒内跑完,校准还比核方法好,因果发现定向更靠谱。原文稍后读已读值得跟进有用关注 BLITZ
11:44官方账号arXiv cs.LG@Suraj Biswas, Saurabh Gupta, Pritam Mukherjee精选研究发现,预训练的生物医学语言模型(如BioBERT、PubMedBERT)在跨领域概念对(如“皮质醇28 ug/dL”与“股市波动性”)上给出高达0.83的余弦相似度,而正确答案应接近零。这种虚假相关性在大型行为模型(LBM)中会导致错误的因果边,进而污染下游推理。研究者提出对比学习方案:第一轮对比训练将PubMedBERT的BIOSSES相关性从0.633提升至0.828,跨领域分离度从1.05倍提升至1.63倍;第二轮BODHI方法通过挖掘知识图谱中的硬负例,将分离度提升至2.30倍,判别差距提升至+0.392。在Intel Xeon 6737P上,OpenVINO将单查询延迟从1367毫秒降至10毫秒(133倍加速),每秒可处理555个句子。研究还发现FP16在该芯片上优于INT8,并解释了原因。论文因果发现嵌入相似度对比学习推荐理由:做因果推断或行为建模的团队会发现,嵌入相似度直接当因果用是危险的——这篇给出了可落地的对比学习方案,还附带了加速脚本,值得直接试。原文稍后读已读值得跟进有用关注 因果发现