论文09:44扩散环境中多臂老虎机策略梯度的收敛与遗憾界这篇论文用Lyapunov函数严格证明了策略梯度在扩散环境老虎机里的收敛性,遗憾界做到O(log T),搞理论的人可以看看。#policy gradient#multi-armed bandits#SDE#Lyapunov函数aarXiv cs.LG@Yanwei Jia, Du Ouyang原文稍后读已读值得跟进有用关注 policy gradient
论文10:09分布式优化中误差反馈算法的紧致理论分析做分布式机器学习或联邦学习的开发者,这篇论文给出了误差反馈算法的理论极限,帮你理解通信压缩到底能省多少而不损失收敛性,值得细读。#分布式优化#误差反馈#通信压缩#收敛性分析aarXiv cs.LG@Daniel Berg Thomsen 等 3 人原文稍后读已读值得跟进有用关注 分布式优化