论文09:54超越模仿:通过离线策略Q-规划提升机器人策略这项研究提出了Q-规划,通过离线策略Q函数与大型视觉运动BC策略的结合,实现了机器人策略的自我改进,显著提升了机器人操作的性能,值得一试。#Q-Planning#机器人策略#自我改进#行为克隆aarXiv cs.LG@Varun Giridhar 等 5 人原文稍后读已读值得跟进有用关注 Q-Planning