15:34官方账号arXiv cs.LG@Ondrej Bajgar, Peter Tisnikar, Alessandro Abate, Konstantinos Gatsis, Maike OsborneQVIRL是一种新型贝叶斯逆强化学习方法,通过变分分布学习最优Q值,从专家演示中推断奖励函数后验。该方法结合了可扩展性与不确定性量化,适用于安全关键应用和主动学习。在网格世界、Lunar Lander、Highway Environment及两个ATARI游戏等任务中表现优异,且是首个能从原始像素观测训练的贝叶斯IRL方法。论文QVIRL逆强化学习贝叶斯推荐理由:想学逆强化学习?QVIRL能边学边给不确定性,还能主动问你要数据,比老方法稳多了。原文稍后读已读值得跟进有用关注 QVIRL