09:44官方账号arXiv cs.LG@Yanwei Jia, Du Ouyang该论文在Wang等(2020)和Jia与Zhou(2022b)的连续时间强化学习框架下,研究扩散环境中多臂老虎机问题的策略梯度更新。使用logit参数化随机策略时,作者证明在任意常数学习率下算法几乎必然收敛到最优臂。此外,当常数学习率低于一个时不变阈值时,得到了非渐近遗憾上界O(log T)。作者通过构造新的Lyapunov函数改进了Lattimore(2026a)对同一SDE的分析,并展示了用SDE工具分析策略梯度的透明性。论文policy gradientmulti-armed banditsSDE推荐理由:这篇论文用Lyapunov函数严格证明了策略梯度在扩散环境老虎机里的收敛性,遗憾界做到O(log T),搞理论的人可以看看。原文稍后读已读值得跟进有用关注 policy gradient
23:15Gary Marcus@GaryMarcus76°MIT和哈佛发布论文《Evaluating Large Language Models in Scientific Discovery》,提出名为SDE的新评估框架。该框架将LLM置于假设提出、实验设计和结果解读的完整研究循环中。测试覆盖生物学、化学、材料科学和物理学的前沿模型。结果显示,LLM在标准科学基准上的表现与真实研究能力之间存在巨大差距。研究者还发现,单纯扩大模型规模无法缩小这一差距。论文LLMSDEMIT推荐理由:MIT和哈佛发了个评测,把前沿LLM丢进真实科研流程,结果它们连假设都提不好。原文稍后读已读值得跟进有用关注 LLM
10:13官方账号arXiv cs.LG@Yuanyuan Wang, Wenjie Wang, Haoxuan Li, Mingming Gong, Kun Zhang精选研究团队在连续时间潜在随机微分方程(SDE)模型中提出了基于环境诱导的扩散协方差偏移的可识别性方法。在共享漂移但环境特定扩散协方差条件下,两个具有成对坐标方差比不同的对角扩散机制可将潜在坐标识别至置换和缩放。该结果首先在线性Ornstein-Uhlenbeck系统中证明,然后推广至一般加性噪声潜SDE。在温和光滑性下,瞬时漂移-雅可比因果图也可识别至相同置换。实验在合成系统和Hardanger大桥监测数据上验证了理论。论文可识别性SDE因果表示学习推荐理由:这篇论文用扩散偏移解决了连续时间潜变量因果模型的可识别性难题,不需要稀疏性假设,还拿真实桥梁数据做了验证,做时间序列因果推断的值得看看。原文稍后读已读值得跟进有用关注 可识别性