AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

QTD

共 1 条相关 AI 资讯
8月28日
19:15
19:15官方账号arXiv cs.LG@Zijie Cheng, Xiang Li, Yang Peng, Zhihua Zhang
精选
该研究建立了表格分布强化学习中同步分位数时序差分学习的全局有限样本保证。研究证明步长α_t=c(t+1)^{-a}(a∈(1/2,1))下,最终迭代波动阶为T^{-a/2}/√(1-γ),与分位数数量无多项式依赖。研究区分了局部随机波动和全局样本复杂度,指出确定性瞬态和所需预热时间仍可能依赖于最小Bellman目标密度。
论文QTD分布强化学习时序差分

推荐理由:强化学习新论文,分析QTD算法的有限样本性能,揭示了波动与样本复杂度的关键区别。
原文
精选全部日报登录