8月17日
10:16
10:16官方账号arXiv cs.LG@Xiaohong Chen, Yuling Jiao, Lican Kang, Jerry Zhijian Yang, Chen Zhong
论文提出用条件扩散模型估计奖励函数和转移核,以构建离线强化学习中的最优Bellman算子。理论给出该算子在总变差距离下的非渐近收敛速率,以及Q*估计的L2收敛率O(n^{-β/(d_x+d_a+2β)})。该分析不依赖完整性假设,状态维度d_x、动作维度d_a和Hölder平滑度β决定了收敛速度。
推荐理由:这篇用扩散模型估计奖励和转移核,再学Q*,收敛率给得很细,还绕开了RL里常见的完整性假设。
7月14日
11:50
11:50官方账号arXiv cs.LG@Alper Kamil Bozkurt, Shangtong Zhang, Yuichi Motai
该论文聚焦离线到在线强化学习(O2O-RL)中有限交互预算下的策略选择问题。提出一种主动策略选择方法,通过上置信界(UCB)平衡策略评估与微调的交互分配。UCB基于局部线性性能预测,在在线评估中拟合观测数据。实验表明该方法在多个基准任务上优于现有O2O-RL基线。这是首个系统研究该问题的学术工作。
推荐理由:这篇论文解决了离线到在线RL中一个关键难题:在有限交互次数下,如何主动挑选微调策略而不是盲目均分预算。实验结果挺实在,值得做RL方向的朋友看看。
7月3日
09:23
09:23官方账号arXiv cs.LG@Max Weltevrede, Matthijs T. J. Spaan, Wendelin Böhmer
论文证明在上下文MDP中,过度悲观不会阻碍最优泛化,但必须尊重最优解的对称性。通过理论分析,适度悲观但非对称的值函数可能比过度悲观且对称的值函数泛化更差。数据增强应通过在策略提取时施加一致性损失来提升泛化,而非在增强数据集上常规训练。使用IQL和CQL在旋转对称reacher环境中验证了该方法。
推荐理由:这篇论文用理论和实验告诉你,离线RL里悲观多少不重要,悲观的结构对不对才关键,还给出了数据增强的正确用法。