09:44官方账号arXiv cs.LG@Yanwei Jia, Du Ouyang该论文在Wang等(2020)和Jia与Zhou(2022b)的连续时间强化学习框架下,研究扩散环境中多臂老虎机问题的策略梯度更新。使用logit参数化随机策略时,作者证明在任意常数学习率下算法几乎必然收敛到最优臂。此外,当常数学习率低于一个时不变阈值时,得到了非渐近遗憾上界O(log T)。作者通过构造新的Lyapunov函数改进了Lattimore(2026a)对同一SDE的分析,并展示了用SDE工具分析策略梯度的透明性。论文policy gradientmulti-armed banditsSDE推荐理由:这篇论文用Lyapunov函数严格证明了策略梯度在扩散环境老虎机里的收敛性,遗憾界做到O(log T),搞理论的人可以看看。原文稍后读已读值得跟进有用关注 policy gradient
10:09官方账号arXiv cs.LG@Daniel Berg Thomsen, Adrien Taylor, Aymeric Dieuleveut该论文针对分布式学习中通信瓶颈问题,对两种主流误差反馈算法(EF和EF21)进行了紧致收敛性分析。通过识别最优步长选择和构建最优Lyapunov函数,作者证明了这些算法在任意数量智能体下的收敛保证,并恢复了单智能体场景下已知的最佳结果。这项研究为理解误差反馈机制在分布式优化中的性能提供了理论基础,有助于设计更高效的通信压缩策略。论文分布式优化误差反馈通信压缩推荐理由:做分布式机器学习或联邦学习的开发者,这篇论文给出了误差反馈算法的理论极限,帮你理解通信压缩到底能省多少而不损失收敛性,值得细读。原文稍后读已读值得跟进有用关注 分布式优化