论文09:44扩散环境中多臂老虎机策略梯度的收敛与遗憾界这篇论文用Lyapunov函数严格证明了策略梯度在扩散环境老虎机里的收敛性,遗憾界做到O(log T),搞理论的人可以看看。#policy gradient#multi-armed bandits#SDE#Lyapunov函数aarXiv cs.LG@Yanwei Jia, Du Ouyang原文稍后读已读值得跟进有用关注 policy gradient