09:54官方账号arXiv cs.LG@Varun Giridhar, Anant Khandelwal, Jeremy A. Collins, Ignat Georgiev, Animesh Garg行为克隆(BC)在机器人操作方面取得了显著进展,但其无法自我改进的局限性限制了其发展。本文提出Q-规划,通过将小型离线策略Q函数与大型视觉运动BC策略相结合,实现了价值引导的动作选择和在线自我改进。在LIBERO和双臂RoboTwin上,10次自我改进将所有基准分数提升(LIBERO-10从93%到99%,RoboTwin从83.8%到91.4%),并缩短了接近上限的套件(LIBERO-Object,LIBERO-Goal)的成功场景。在两个接触丰富的双臂真实机器人任务中,相同的循环(BC冻结,无人工干预)仅通过其自身的部署回放就纯粹提升了40%到90%(堆叠杯子)和25%到80%(插入钱包),而仅对成功回放进行SFT则停滞在55%和30%。在相同的在线预算下,Q-规划是唯一一种在Best-of-N、过滤SFT、IBRL、DSRL和DAWR中稳定地从失败中改进而不需要训练辅助演员的方法。论文Q-Planning机器人策略自我改进推荐理由:这项研究提出了Q-规划,通过离线策略Q函数与大型视觉运动BC策略的结合,实现了机器人策略的自我改进,显著提升了机器人操作的性能,值得一试。原文稍后读已读值得跟进有用关注 Q-Planning