8月5日
7月15日
6月26日
11:34
11:34官方账号arXiv cs.AI@Aoyang Fang, Yifan Yang, Jin'ao Shang, Qisheng Lu, Junjielung Xu, Rui Wang, Songhan Zhang, Yuzhong Zhang, Boxi Yu, Pinjia He
OpenRCA 2.0 引入了 PAVE 协议,通过故障注入重建因果传播路径,标注了 500 个跨系统实例的步骤级因果链。在 11 个前沿 LLM 上测试,完全恢复根因集的成功率平均仅 20.7%。放宽条件后发现,模型在 76.0% 的案例中能识别至少一个正确根因服务,但只有 61.5% 能将服务与观察到的症状通过验证的因果路径关联起来。该基准揭露了仅靠结果标签评估时隐藏的未接地诊断失败模式。
推荐理由:这篇论文搞了个新基准 OpenRCA 2.0,用 PAVE 协议给每一步因果关系打标签,发现 LLM 猜对根因容易,但连对因果路径很难——这比只看结果靠谱多了。
6月19日
11:37
11:37官方账号arXiv cs.AI@Saimun Habib, Vaishak Belle, Fengxiang He
DeepSWIP为DeepProbLog引入单世界反事实语义,通过神经具体化将固定上下文神经谓词转为ProbLog选择,并应用单世界干预程序(SWIP)计算反事实。实验在MPI3D数据集上对比DeepTwin构造,针对12,000个查询实现2.14倍推理加速。SUMO HOV实验表明神经校准退化会偏误插件估计,而AIPW估计器可消除大部分一阶偏差。代码已开源。
推荐理由:想给概率逻辑程序加上精准的反事实推理?DeepSWIP用商WMC方法避免了DeepTwin的内生重复,实测快两倍多,做因果推断的朋友可以看看。
6月16日
10:24
10:24官方账号arXiv cs.LG@Mohamed Manzour, Aditya Kumar, Augusto Luis Ballardini, Miguel Ángel Sotelo
该框架采用因果推断方法进行换道预测,结合专家约束因果发现与Deep End-to-end Causal Inference (DECI) 模型。在车道线跨越事件前3秒内,平均F1分数超过95%。通过干预效应分析区分直接贡献变量与中介效应,并生成对比因果链解释。与传统基于相关性分类的方法不同,该框架提供可解释的因果推理。
推荐理由:这篇论文把换道预测从统计相关提升到因果推理,用DECI模型实现了95%以上的F1分数,还给出了清晰的因果链解释,做自动驾驶可解释性的一定要看。
5月18日
08:09
08:09berryxia@berryxia
78°
Google最新论文Nexus颠覆了传统时间序列预测方法,不再仅依赖历史数据,而是引入“事件上下文”进行因果推理。论文提出多agent框架:一个agent从文本提取事件时间线,一个分析宏观趋势,一个监控局部冲击,最后由合成器校准历史误差并给出预测。在Zillow数据集上,Claude驱动的Nexus版本将平均MAPE降低了86.6%。这标志着预测从“模式识别”转向“因果理解”,是方法论上的重大突破。

推荐理由:做时间序列预测的团队终于有了新思路——不再死磕历史曲线,而是用多agent理解政策、突发事件等因果因素,效果直接降维打击。搞量化、供应链或金融预测的开发者建议点开,看看怎么把文本推理融入预测流程。
5月17日
5月13日
21:36
21:36官方一手Anthropic: Research资讯
75°
Anthropic 发布了一项新研究,旨在通过教 AI 模型理解“为什么”来减少智能体对齐问题。研究指出,当前 AI 智能体在执行任务时,常因缺乏对指令背后意图的理解而产生误操作。通过引入因果推理和解释性训练,模型能更好地遵循人类意图,降低对齐失败的风险。该工作为构建更可靠、更安全的 AI 智能体提供了新思路。
事件专题

推荐理由:做 AI 安全和对齐的研究者值得关注——Anthropic 用“教为什么”的思路解决了智能体误解指令的痛点,直接关系到未来自主系统的可靠性。