11:52官方账号arXiv cs.AI@Avinash Kori, Fabrizio Russo这篇论文从因果视角研究世界模型,提出超越生成能力、捕捉实体属性及其交互的因果世界模型(CWM)正式定义。作者将世界建模与因果表示学习、目标中心学习、因果发现、结构因果模型及基于模型的决策制定等工作联系起来。论文还探讨了可识别性文献,澄清世界模型组件何时能从数据中恢复以及等价性边界。论文世界模型因果推理因果表示学习推荐理由:如果你在搞世界模型或因果推理,这篇把概念理清了,还连上了因果发现的现有工作,值得一看。原文稍后读已读值得跟进有用关注 世界模型
12:17官方账号arXiv cs.AI@Jannick Strobel, Muqsit Azeem, Stefan Leue该论文将神经网络预测的解释形式化为 Halpern-Pearl 实际原因,并用布尔结构因果模型(SCM)建模输入依赖。算法结合边界传播与分支定界,提供完备性和最小性保证。实验中,它在搜索空间达 2.3×10^13 个候选对、SCM 最多 28 个节点的实例上,于 180 秒内算出全部最小实际原因,规模上超过暴力搜索和 ILP 基线。案例研究显示,忽略输入依赖会使报告原因数量膨胀,其中 14.9% 在 SCM 下是虚假原因。论文Halpern-Pearl结构因果模型神经网络可解释性推荐理由:它把解释当HP实际原因,用SCM建模输入依赖,搜索算法保证完备且最小,还发现忽视依赖会多出14.9%虚假原因。原文稍后读已读值得跟进有用关注 Halpern-Pearl
11:30官方账号arXiv cs.AI@Jose M. Álvarez该论文首次实现了 Álvarez 和 Ruggieri (2025) 提出的因果感知概率框架。论文将因果感知区分为结构性和参数性两类,并设计了基于 SCM 的算法来计算干预分布与反事实分布。在 German Credit 数据集上的多专家决策实验中,因果感知改变了公平性评估和基于阈值的决策。结果显示,感知判定对距离度量和阈值的选择敏感,偏见相对于智能体的 SCM 具有情境性。论文SCM因果感知公平性推荐理由:这篇论文把因果感知从理论变成了能跑的算法,在德国信用数据集上验证了不同模型对公平性判断的影响,值得搞公平性研究的人看看。原文稍后读已读值得跟进有用关注 SCM
09:25官方账号arXiv cs.LG@Xining Xun在辛普森悖论设定下,增加预训练中干预样本比例并不能让模型正确判断因果方向,do()响应幅度增大但符号仍复制观察上下文。完全观察上下文在50个世界中29个出现符号反转,混合上下文19个,而仅对齐干预探针则41个正确。擦除上下文中的观察证据立即释放模型被压制的因果插值能力(ratio_true=+0.56)。在0.93B参数模型上,匹配探针仅干预分支的符号反转率为6%,而观察+干预分支为31.8%。作者提出证据平均协议,将符号错误从26%降至9%。论文CLadder辛普森悖论因果推理推荐理由:这篇论文用辛普森悖论测试干预数据,发现模型因果方向取决于上下文证据类型而非训练比例,还给了降错方案。原文稍后读已读值得跟进有用关注 CLadder
12:22官方账号arXiv cs.LG@Srikanth Avasarala, Varun Gupta, Shahin Jabbari, Saber Salehkaleybar, Juba Ziani本文提出一种因果执行框架,建模追责行为通过结构因果模型传播以及对真实标签的影响。该框架将追责策略优化转化为非凸问题,并给出可高效计算的稳定均衡条件。在半合成和真实信用数据集上的实验表明,忽略因果结构的追责会诱导大规模错位行为,而因果追责能减少博弈激励并降低重复训练需求。与标准经验风险最小化相比,该方法在预测一致性上持续更优。论文算法追责因果推理可执行改变推荐理由:这篇论文讲了算法追责如果不考虑因果,用户容易钻空子,用因果框架能让系统更稳定,值得搞机器学习的人看看。原文稍后读已读值得跟进有用关注 算法追责
10:57官方账号arXiv cs.LG@Jiyuan Tan, Vasilis SyrgkanisCausalForge是一个基于Lean证明助手的自动化因果推理研究框架。它结合了CausalLean库(含7,035个机器验证声明)和CausalSmith自改进智能体管道。该框架通过机器验证证明和语句审计,解决了LLM评审在2025年Bad Scientist研究中被指出的不可靠问题(接受伪造论文的概率接近随机)。已完成自主研究运行,并在GitHub公开源码、库和运行记录。AI模型CausalForgeCausalLeanCausalSmith推荐理由:CausalForge用Lean做因果推理自动研究,能验证证明并审计陈述,比纯LLM评审靠谱。原文稍后读已读值得跟进有用关注 CausalForge
11:31官方账号arXiv cs.LG@Jorge Diaz Chao, Konpat Preechakul, Yuxi Liu, Yutong Bai论文通过多球硬球动力学实验发现,标准双向视频扩散模型在因果链长度增加时性能显著下降,即使增加去噪步数也无法缓解。长度匹配的单球控制实验排除了视频长度的影响,证明依赖事件结构才是主因。自回归/逐块生成和增加架构深度等方法能有效提升序列推理性能,但去噪步数本身不增加序列计算。作者将此模式定义为序列性差距,并证明确定性视频预测中,去噪步数无法提供可扩展的序列计算能力。论文视频扩散模型Seriality Gap多球硬球动力学推荐理由:这篇论文用多球碰撞实验揭示了视频扩散模型做因果推理时的短板,增加去噪步数没用,但自回归和加深网络有效。对做视频生成和物理模拟的人很有启发。原文稍后读已读值得跟进有用关注 视频扩散模型
11:00官方账号arXiv cs.AI@Sen Yang, Yuen-Hei Yeung对齐LLM在非证据激励(如用户信心)下会误报,违背内部激励相容(IC)。研究提出反事实报告协调(CRC)方法,通过因果交换干预识别低秩报告坐标(答案、置信度、预警)。在Bayesian-witness基准上,两遍夹钳实现联合resist和update得分1.00(Wilson 95% CI [0.99,1.00])。单遍编译有损耗,resist和update为0.73和0.97。方法在三个模型家族和SycophancyEval上复现,提供激活级因果不变性作为内部IC的结构原语。论文LLM激励相容反事实干预推荐理由:这篇论文用因果干预把LLM的内部报告拆解成抵抗压力和更新证据两个维度,在测试中做到满分,比一般对齐方法更扎实。原文稍后读已读值得跟进有用关注 LLM
09:29官方账号arXiv cs.AI@Evgenii Vityaev该论文针对Carl Hempel提出的归纳-统计推理中的统计模糊性问题,使用Nancy Cartwright的因果定义(概率提升)引入因果规则概念,定义了一种语义概率推理程序逐步精炼因果规则,得到最大特定因果关系(MSCR)。论文证明(Theorem 1)基于MSCR的预测是一致的,从而解决了统计模糊性问题。该语义概率推理程序可作为一种概率因果学习系统,用于因果AI和因果机器学习领域。论文HempelCausal AIMSCR推荐理由:这篇论文用因果规则和MSCR证明解决了统计模糊性问题,理论扎实,适合想深入因果AI原理的人看。原文稍后读已读值得跟进有用关注 Hempel
11:34官方账号arXiv cs.AI@Aoyang Fang, Yifan Yang, Jin'ao Shang, Qisheng Lu, Junjielung Xu, Rui Wang, Songhan Zhang, Yuzhong Zhang, Boxi Yu, Pinjia HeOpenRCA 2.0 引入了 PAVE 协议,通过故障注入重建因果传播路径,标注了 500 个跨系统实例的步骤级因果链。在 11 个前沿 LLM 上测试,完全恢复根因集的成功率平均仅 20.7%。放宽条件后发现,模型在 76.0% 的案例中能识别至少一个正确根因服务,但只有 61.5% 能将服务与观察到的症状通过验证的因果路径关联起来。该基准揭露了仅靠结果标签评估时隐藏的未接地诊断失败模式。论文OpenRCA 2.0PAVELLM推荐理由:这篇论文搞了个新基准 OpenRCA 2.0,用 PAVE 协议给每一步因果关系打标签,发现 LLM 猜对根因容易,但连对因果路径很难——这比只看结果靠谱多了。原文稍后读已读值得跟进有用关注 OpenRCA 2.0
11:37官方账号arXiv cs.AI@Saimun Habib, Vaishak Belle, Fengxiang HeDeepSWIP为DeepProbLog引入单世界反事实语义,通过神经具体化将固定上下文神经谓词转为ProbLog选择,并应用单世界干预程序(SWIP)计算反事实。实验在MPI3D数据集上对比DeepTwin构造,针对12,000个查询实现2.14倍推理加速。SUMO HOV实验表明神经校准退化会偏误插件估计,而AIPW估计器可消除大部分一阶偏差。代码已开源。论文DeepSWIPDeepProbLog反事实推理推荐理由:想给概率逻辑程序加上精准的反事实推理?DeepSWIP用商WMC方法避免了DeepTwin的内生重复,实测快两倍多,做因果推断的朋友可以看看。原文稍后读已读值得跟进有用关注 DeepSWIP
10:24官方账号arXiv cs.LG@Mohamed Manzour, Aditya Kumar, Augusto Luis Ballardini, Miguel Ángel Sotelo该框架采用因果推断方法进行换道预测,结合专家约束因果发现与Deep End-to-end Causal Inference (DECI) 模型。在车道线跨越事件前3秒内,平均F1分数超过95%。通过干预效应分析区分直接贡献变量与中介效应,并生成对比因果链解释。与传统基于相关性分类的方法不同,该框架提供可解释的因果推理。论文换道预测因果推理自动驾驶推荐理由:这篇论文把换道预测从统计相关提升到因果推理,用DECI模型实现了95%以上的F1分数,还给出了清晰的因果链解释,做自动驾驶可解释性的一定要看。原文稍后读已读值得跟进有用关注 换道预测
09:48官方一手arXiv: DeepSeek@Pierre Beckmann, Marco Valentino, Andre Freitas精选SciR 是一个新的科学推理基准,专门评估大语言模型在科学场景下的演绎、归纳和因果推理能力。它通过从形式化对象(如演绎树、归纳规则假设、因果图)生成任务,确保答案可验证,再渲染成多文档科学文本。该基准独立控制两个难度轴:信息提取难度和推理本身难度,从而揭示模型在不同维度上的表现差异。测试六个模型后发现,两个难度轴都会降低模型性能,且效果叠加,即使是神经符号管道也受渲染影响。推理模型如DeepSeek-R1主要在推理轴上优于非推理指令模型。论文科学推理LLM评估基准测试推荐理由:做LLM评估和科学推理研究的团队终于有了一个能独立控制提取与推理难度的基准,可以精准诊断模型短板。想了解自家模型在科学推理上到底弱在哪,建议直接看这篇。原文稍后读已读值得跟进有用关注 科学推理
21:46rohanpaul_ai@rohanpaul_ai李飞飞指出,大语言模型擅长处理文本模式,能描述房间,但无法理解椅子移动、玻璃破碎或阳光变化时房间如何改变。她强调,世界模型旨在学习视觉背后的隐藏结构,能预测相机未捕捉的视角、模拟物体行为,并支持实体智能体在真实或虚拟环境中行动。这种模型需要共同理解空间、因果和后果,是AI从文本走向物理世界的关键一步。论文世界模型李飞飞物理智能推荐理由:李飞飞点出了LLM的物理盲区,做机器人、自动驾驶或空间计算的团队,看完会重新思考模型架构。原文稍后读已读值得跟进有用关注 世界模型
12:44官方一手arXiv: OpenAI@Dhairya Dalal, Endre Sara, Ben Yemini, Christine Miller, Shmuel Kliger精选72°Causely 提出一种因果智能层,将原始可观测性遥测数据转化为结构化的拓扑与因果模型,为AI代理提供语义和因果基础。在24微服务的OpenTelemetry演示应用中,通过注入故障进行基准测试,对比Claude Code、OpenAI Codex等四种代理配置。实验显示,使用Causely后,平均诊断时间降低63%,令牌消耗减少60%,工具调用次数下降78%,根因诊断准确率从75%提升至100%。该方法解决了AI代理在SRE场景中因缺乏环境因果理解而导致的效率低下和成本高昂问题。论文因果推理SRE/运维AI代理10 个信源在谈事件专题推荐理由:做SRE或运维自动化的团队,终于有了让AI代理真正理解生产环境因果关系的方案——诊断时间砍半、成本降六成,值得直接拿demo试试。原文稍后读已读值得跟进有用关注 因果推理
08:09berryxia@berryxia78°Google最新论文Nexus颠覆了传统时间序列预测方法,不再仅依赖历史数据,而是引入“事件上下文”进行因果推理。论文提出多agent框架:一个agent从文本提取事件时间线,一个分析宏观趋势,一个监控局部冲击,最后由合成器校准历史误差并给出预测。在Zillow数据集上,Claude驱动的Nexus版本将平均MAPE降低了86.6%。这标志着预测从“模式识别”转向“因果理解”,是方法论上的重大突破。论文时间序列预测多agent框架因果推理推荐理由:做时间序列预测的团队终于有了新思路——不再死磕历史曲线,而是用多agent理解政策、突发事件等因果因素,效果直接降维打击。搞量化、供应链或金融预测的开发者建议点开,看看怎么把文本推理融入预测流程。原文稍后读已读值得跟进有用关注 时间序列预测
23:39rohanpaul_ai@rohanpaul_ai精选72°Google 发布新论文 Nexus,提出将时间序列预测重构为推理问题,通过多智能体框架引入事件上下文。在 Zillow 房价测试中,基于 Claude 的版本相比直接思维链提示,平均绝对百分比误差(MAPE)降低 86.6%。Nexus 将任务分解为多个智能体:一个将混乱历史文本转为事件时间线,一个读取宏观环境,一个追踪局部冲击,最后由合成器结合历史误差校准。论文认为,大多数时间序列模型擅长模式但忽视因果,而 Nexus 通过结构化上下文让语言模型更好地利用事件信息。目前证据限于 Zillow 数据和七支股票,但方向明确:未来预测不仅要外推曲线,还要解释曲线变动的原因。论文时间序列预测多智能体框架因果推理推荐理由:Nexus 把时间序列预测从纯数字游戏变成因果推理,做金融、房地产或供应链预测的团队值得关注——它用事件上下文把误差砍掉 86%,思路可以直接借鉴。原文稍后读已读值得跟进有用关注 时间序列预测
13:22Gary Marcus@GaryMarcus精选Gary Marcus 等学者在皇家学会《哲学汇刊 A》组织了一期关于“世界模型”的特刊,集结了 Michael Levin、David Ha、Melanie Mitchell、Joshua Tenenbaum 等顶尖研究者。特刊聚焦于当前 LLM 的局限,探讨如何通过构建世界模型实现更接近自然智能的 AI,包括因果推理、系统 2 认知和意识等核心问题。文章指出,世界模型可能是让 AI 具备可靠推理和泛化能力的关键,甚至关系到 AI 安全的未来。这一特刊标志着学界开始认真面对“超越 LLM”的硬问题。论文世界模型AGI自然智能推荐理由:世界模型是 AI 从“鹦鹉”走向“真正理解”的关键一步,做 AI 研究或关注 AGI 路径的人,这篇特刊的阵容和问题清单值得细读。原文稍后读已读值得跟进有用关注 世界模型
21:36官方一手Anthropic: Research(资讯)75°Anthropic 发布了一项新研究,旨在通过教 AI 模型理解“为什么”来减少智能体对齐问题。研究指出,当前 AI 智能体在执行任务时,常因缺乏对指令背后意图的理解而产生误操作。通过引入因果推理和解释性训练,模型能更好地遵循人类意图,降低对齐失败的风险。该工作为构建更可靠、更安全的 AI 智能体提供了新思路。论文智能体AI 安全对齐10 个信源在谈事件专题推荐理由:做 AI 安全和对齐的研究者值得关注——Anthropic 用“教为什么”的思路解决了智能体误解指令的痛点,直接关系到未来自主系统的可靠性。原文稍后读已读值得跟进有用关注 智能体