7月21日
12:08
12:08官方账号arXiv cs.LG@Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun, Lerrel Pinto
Patch Policy是一种轻量级架构扩展,让基于Transformer的机器人策略直接使用预训练的ViT密集补丁特征,避免全量视觉语言模型(VLM)的计算开销。该方法引入块因果注意力掩码,在保持时间因果性的同时处理多个补丁令牌。在4个仿真和3个真实环境套件中,Patch Policy相比使用全局池化表示的策略实现了40%的相对提升。此外,它仅用OpenVLA-OFT约0.7%的参数,就超越了微调后的OpenVLA-OFT 18%的性能。
推荐理由:机器人控制不用再扛百亿参数VLM了,用ViT密集补丁特征直接训练,速度更快、参数量少99.3%,性能还涨18%。想轻量高效做具身策略的可以看这篇。
7月17日
09:52
09:52官方账号arXiv cs.AI@Weishuai Zeng, Kangning Yin, Xiaojie Niu, Shunlin Lu, Weixiang Zhong, Jiahe Chen, Feiyu Jia, Xiao Chen, Zirui Wang, Furui Xu, Ming Zhou, Kailin Li, Weinan Zhang, He Wang, Li Yi, Dahua Lin, Jiangmiao Pang, Jingbo Wang
72°
该论文提出行为基础模型(BFM)的缩放配方,核心包括运动跟踪学习范式、策略同步量与参考动作多样性的协同、以及可扩展的Humanoid Transformer架构。在仿真和真实世界部署中,Humanoid Transformer将局部模式下的平均关键点位置误差(MPKPE)降低10%以上,全局模式下降低82%。相比现有仿人控制器,该方法显著提升了控制保真度和任务泛化能力。论文验证了BFM作为通用仿人控制基础的有效性。
推荐理由:这篇论文把仿人机器人控制的缩放问题拆解清楚了:Humanoid Transformer配合特定训练范式,让MPKPE直接降了82%,比现有控制器强一大截。
7月15日
09:56
09:56官方账号arXiv cs.LG@Paolo Magliano, Puze Liu, Jan Peters, Davide Tateo, Raffaello Camoriano
安全强化学习中,约束常降低学习速度并导致次优性能。ATACOM-DC方法在ATACOM框架基础上引入方向性约束,区分靠近和远离约束边界的动作。仅在必要时激活约束,改善安全与任务性能的权衡。在多个模拟机器人控制任务中评估了约束违规成本和任务性能。代码已开源。
推荐理由:ATACOM-DC改进了安全强化学习,通过方向性约束只在必要时限制动作,比普通方法探索更高效。
7月11日
22:58
22:58elvis@omarsar0
LingBot VA-V2是Robbyant(蚂蚁集团旗下)开发的视频动作基础模型,原生用于机器人控制。该模型接收视频输入即可生成机器人动作指令,无需额外传感器。项目页面和完整论文已在GitHub公开,提供技术细节与基准评测。
事件专题

推荐理由:Robbyant这个视频动作模型直接用视频训练机器人,别家还没见过类似的。论文和代码全公开,搞机器人和具身智能的可以看看。
6月16日
22:10
6月11日
10:05
10:05官方账号arXiv cs.LG@Hyun Joe Jeong, Gokul Swamy, Andrea Bajcsy
精选
该研究提出一种框架,通过交互式搜索语言序列来提升视觉-语言-动作(VLA)模型的闭环任务性能,并蒸馏为测试时的语言反馈策略(LFP)。同时学习一个改进头,预测何时语言引导能提升性能,并通过保形化处理防止有害干预。该方法适用于任意冻结的预训练VLA模型,无需访问原始训练数据或微调。在模拟和硬件实验中,该策略分别将基础VLA性能提升24.7%和65.0%,且在视觉和语义扰动下具有强无害性保证。
推荐理由:机器人开发者终于有了一个无需重新训练就能安全引导VLA模型的方法——通过语言反馈策略提升任务成功率,同时避免有害行为。做机器人控制或人机交互的团队可以直接在现有模型上尝试,值得关注。