#机器人学习
想让机器人从人类视频里学技能的可以看看这篇,EgoLAP 不硬抄人类动作,改成学语言化的动作意图,真实任务进度做到 80.1%,比其他表示高 2.3 倍。
一篇 VLA 训练新论文,思路挺巧:同一批数据换个揭示顺序当正则,LIBERO 和 CALVIN 上都有提升,做机器人策略的可以看看。
想提前看到机器人圈动向,关注这 5 个人:NVIDIA 的 Jim Fan、Physical Intelligence 两位创始人、ALOHA 作者和 LeRobot 发起人。
Sakana AI 和东大搞了个给机器人“先在模拟器里彩排再上场”的方法 SAIL,成功率能从 25% 拉到 73%,做机器人方向的可以看看。
机器人换个机位就翻车的问题有解了:InfiNoVA 用 3D Gaussian 造新视角训练数据,陌生视角成功率提升 5.4 倍,不用改模型架构。
机器人移动操作总因底盘跑偏而失败?这篇论文让策略直接预测地图坐标系下的底盘目标位姿再用定位反馈去跟踪,6 个真实任务成功率全赢速度控制,做具身智能的可以看看。
朋友,宾夕法尼亚大学新开了一门「World Models」课,讲义公开了。这门课讲的是让AI模型学会预测世界变化,不是单纯靠文本训练。内容挺硬核,有基础理论、生成模型,还有视频、机器人这些应用,适合想深入了解世界模型的同学。
想搞机器人数据闭环的可以看看,Hugging Face和亚马逊把记录、训练、部署全串在一起了,不用再东拼西凑工具。
X Square Robot 开源了 HOST,机器人看 29 秒演示就能学,成功率 62%。和传统微调不一样,它当场模仿。
斯坦福和英伟达搞了个新方法RoboTTT,能让机器人记住5分钟内的动作历史,一次看人演示就能模仿,还能自己纠错。上下文越长效果越好,8K比1K强62%。
机器人学习领域长期面临泛化难题,这篇论文从结构分解入手给出了新解法。做机器人策略研究或部署的团队值得关注,零样本迁移到真实硬件意味着可以直接减少重复训练成本。