10:06官方账号arXiv cs.LG@Luca Viano, Antoine Moulin, Audrey Huang, Volkan Cevher, Philip Amortila, Dylan J. Foster该论文研究专家交互在模仿学习中的作用,发现交互可放宽对学习者模型的表征要求,只需实现专家价值函数而非完整策略。作者提出OVI算法,在能表示专家价值函数时统计高效,并借助线性最大化预言机实现计算高效。负向结果表明,在仅具备价值可实现性假设下,离线模仿学习算法必须依赖策略类复杂度。实验显示OVI优于BC、DAgger及离线价值法,在模型表达能力弱于专家时增益最大。论文模仿学习OVI交互式学习推荐理由:这篇论文把模仿学习里交互到底帮不帮忙讲清楚了,还给了能跑的OVI算法,做RL或蒸馏的值得看一眼。原文稍后读已读值得跟进有用关注 模仿学习