11:11官方账号arXiv cs.LG@Andrej Orsula, Miguel Olivares-Mendez, Carol Martinez针对太空机器人极端环境中的硬件退化问题,提出一种无奖励持续学习框架,利用潜在状态世界模型进行在线适应。通过在多样化模拟中预训练模型代理,世界模型学习其潜在空间中的奖励结构预测器。在部署到硬件退化严重的环境中,仅通过无监督回滚更新世界模型的转换动态。通过训练策略以更新后的世界模型生成的想象轨迹,代理适应改变的动力而不需要新的奖励。在模拟行星穿越、轨道导航和精密组装任务中展示了该方法的有效性。论文智能体持续学习太空机器人推荐理由:这篇论文提出了一种无奖励持续学习框架,对于太空机器人适应硬件退化问题有重要意义,值得一读。原文稍后读已读值得跟进有用关注 智能体