论文09:44扩散环境中多臂老虎机策略梯度的收敛与遗憾界这篇论文用Lyapunov函数严格证明了策略梯度在扩散环境老虎机里的收敛性,遗憾界做到O(log T),搞理论的人可以看看。#policy gradient#multi-armed bandits#SDE#Lyapunov函数aarXiv cs.LG@Yanwei Jia, Du Ouyang原文稍后读已读值得跟进有用关注 policy gradient
论文76°23:15MIT与哈佛新论文:LLM无法真正进行科学发现MIT和哈佛发了个评测,把前沿LLM丢进真实科研流程,结果它们连假设都提不好。#LLM#SDE#MIT#科学发现Gary Marcus@GaryMarcus原文稍后读已读值得跟进有用关注 LLM
论文精选10:13利用扩散偏移解耦连续时间潜在SDE的可识别性这篇论文用扩散偏移解决了连续时间潜变量因果模型的可识别性难题,不需要稀疏性假设,还拿真实桥梁数据做了验证,做时间序列因果推断的值得看看。#可识别性#SDE#因果表示学习#扩散偏移aarXiv cs.LG@Yuanyuan Wang 等 5 人原文稍后读已读值得跟进有用关注 可识别性