15:34官方账号arXiv cs.LG@Ondrej Bajgar, Peter Tisnikar, Alessandro Abate, Konstantinos Gatsis, Maike OsborneQVIRL是一种新型贝叶斯逆强化学习方法,通过变分分布学习最优Q值,从专家演示中推断奖励函数后验。该方法结合了可扩展性与不确定性量化,适用于安全关键应用和主动学习。在网格世界、Lunar Lander、Highway Environment及两个ATARI游戏等任务中表现优异,且是首个能从原始像素观测训练的贝叶斯IRL方法。论文QVIRL逆强化学习贝叶斯推荐理由:想学逆强化学习?QVIRL能边学边给不确定性,还能主动问你要数据,比老方法稳多了。原文稍后读已读值得跟进有用关注 QVIRL
18:12官方账号arXiv cs.LG@Nikita Sevriukov, Anna Barabanova, Uliana Gagarina, Karina Ivanova, Sofiia Kasaeva, Ilya Levin, Marina Sheshukova逆强化学习(IRL)旨在从专家演示中恢复奖励函数,通常被建模为双层优化问题,内层为策略优化,外层衡量策略与专家数据的差异。然而,外层更新需要计算涉及内层目标逆Hessian向量积的超梯度,计算成本高昂。本文证明在内层最优处,内层目标的Hessian与策略的Fisher信息矩阵成正比,从而提出基于Fisher的超梯度,与自然超梯度下降紧密相关。为应对大规模Fisher矩阵的瓶颈,作者使用流式谱草图近似逆Fisher向量积,避免显式构造Fisher矩阵。在离散和连续控制环境中,该方法相比一阶随机双层基线,实现了有竞争力的策略性能和奖励排序质量,同时降低了曲率存储复杂度并提升了计算效率。论文逆强化学习超梯度Fisher信息矩阵推荐理由:这篇论文给IRL的超梯度计算找了个巧妙的捷径,用Fisher矩阵和谱草图省下大量算力,做强化学习的朋友可以看看。原文稍后读已读值得跟进有用关注 逆强化学习
09:37官方账号arXiv cs.AI@Ali Larian, Qian Lin, Chang Zong Wu, Daniel S. Brown该论文研究如何在多环境下学习鲁棒的奖励函数,避免逆强化学习(IRL)因单环境演示而过拟合。作者分析了不同反馈模态(如比较、演示)对奖励约束的强度,发现比较模态在无限数据下提供更强的全局约束。提出一种分层机器教学算法,先贪婪选择互补环境,再在最优环境下查询低成本反馈。在实验中,该方法在相同反馈预算下相比均匀基线显著降低了后悔值(regret),并提升了到未见过环境的泛化能力。论文逆强化学习IRL机器教学推荐理由:想解决机器人奖励函数跨环境失效的问题?这篇论文给出了数学分析和一种更聪明的教学策略,用更少反馈让奖励更鲁棒。原文稍后读已读值得跟进有用关注 逆强化学习