AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

multi-armed bandits

共 1 条相关 AI 资讯
8月3日
09:44
09:44官方账号arXiv cs.LG@Yanwei Jia, Du Ouyang
该论文在Wang等(2020)和Jia与Zhou(2022b)的连续时间强化学习框架下,研究扩散环境中多臂老虎机问题的策略梯度更新。使用logit参数化随机策略时,作者证明在任意常数学习率下算法几乎必然收敛到最优臂。此外,当常数学习率低于一个时不变阈值时,得到了非渐近遗憾上界O(log T)。作者通过构造新的Lyapunov函数改进了Lattimore(2026a)对同一SDE的分析,并展示了用SDE工具分析策略梯度的透明性。
论文policy gradientmulti-armed banditsSDE

推荐理由:这篇论文用Lyapunov函数严格证明了策略梯度在扩散环境老虎机里的收敛性,遗憾界做到O(log T),搞理论的人可以看看。
原文
精选全部日报登录