AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

OVI

共 1 条相关 AI 资讯
8月3日
10:06
10:06官方账号arXiv cs.LG@Luca Viano, Antoine Moulin, Audrey Huang, Volkan Cevher, Philip Amortila, Dylan J. Foster
该论文研究专家交互在模仿学习中的作用,发现交互可放宽对学习者模型的表征要求,只需实现专家价值函数而非完整策略。作者提出OVI算法,在能表示专家价值函数时统计高效,并借助线性最大化预言机实现计算高效。负向结果表明,在仅具备价值可实现性假设下,离线模仿学习算法必须依赖策略类复杂度。实验显示OVI优于BC、DAgger及离线价值法,在模型表达能力弱于专家时增益最大。
论文模仿学习OVI交互式学习

推荐理由:这篇论文把模仿学习里交互到底帮不帮忙讲清楚了,还给了能跑的OVI算法,做RL或蒸馏的值得看一眼。
原文
精选全部日报登录