19:15官方账号arXiv cs.LG@Zijie Cheng, Xiang Li, Yang Peng, Zhihua Zhang精选该研究建立了表格分布强化学习中同步分位数时序差分学习的全局有限样本保证。研究证明步长α_t=c(t+1)^{-a}(a∈(1/2,1))下,最终迭代波动阶为T^{-a/2}/√(1-γ),与分位数数量无多项式依赖。研究区分了局部随机波动和全局样本复杂度,指出确定性瞬态和所需预热时间仍可能依赖于最小Bellman目标密度。论文QTD分布强化学习时序差分推荐理由:强化学习新论文,分析QTD算法的有限样本性能,揭示了波动与样本复杂度的关键区别。原文稍后读已读值得跟进有用关注 QTD