8月5日
10:20
10:20官方账号arXiv cs.AI@Fan Yang, Yuting Su, Xiaobo Wang, Yuncheng You, Fugui Fan, Yuting Wu, Minghui Wu, Chenxu Zhao, JiaHong Ning, Peiguang Jing
LiLa-WAM在紧凑潜在空间中推理未来场景,可在单个24GB GPU上端到端训练,避免像素空间法的高开销。其核心是联合塑造的未来状态预测与动作生成机制,并提出了语言无关的视觉转换标记(VTT)作为任务表征。在RoboTwin 2.0的50个任务中取得90.48%成功率,且同时在LIBERO和真实机器人任务上验证了有效性。
推荐理由:LiLa-WAM用一张24GB显卡就能训练,在RoboTwin 2.0上50个任务做到90%以上成功率,还不用语言标注任务,做机器人操控的值得看看。