AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

谱草图

共 1 条相关 AI 资讯
8月12日
18:12
18:12官方账号arXiv cs.LG@Nikita Sevriukov, Anna Barabanova, Uliana Gagarina, Karina Ivanova, Sofiia Kasaeva, Ilya Levin, Marina Sheshukova
逆强化学习(IRL)旨在从专家演示中恢复奖励函数,通常被建模为双层优化问题,内层为策略优化,外层衡量策略与专家数据的差异。然而,外层更新需要计算涉及内层目标逆Hessian向量积的超梯度,计算成本高昂。本文证明在内层最优处,内层目标的Hessian与策略的Fisher信息矩阵成正比,从而提出基于Fisher的超梯度,与自然超梯度下降紧密相关。为应对大规模Fisher矩阵的瓶颈,作者使用流式谱草图近似逆Fisher向量积,避免显式构造Fisher矩阵。在离散和连续控制环境中,该方法相比一阶随机双层基线,实现了有竞争力的策略性能和奖励排序质量,同时降低了曲率存储复杂度并提升了计算效率。
论文逆强化学习超梯度Fisher信息矩阵

推荐理由:这篇论文给IRL的超梯度计算找了个巧妙的捷径,用Fisher矩阵和谱草图省下大量算力,做强化学习的朋友可以看看。
原文
精选全部日报登录