7月21日
12:08
12:08官方账号arXiv cs.LG@Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun, Lerrel Pinto
Patch Policy是一种轻量级架构扩展,让基于Transformer的机器人策略直接使用预训练的ViT密集补丁特征,避免全量视觉语言模型(VLM)的计算开销。该方法引入块因果注意力掩码,在保持时间因果性的同时处理多个补丁令牌。在4个仿真和3个真实环境套件中,Patch Policy相比使用全局池化表示的策略实现了40%的相对提升。此外,它仅用OpenVLA-OFT约0.7%的参数,就超越了微调后的OpenVLA-OFT 18%的性能。
推荐理由:机器人控制不用再扛百亿参数VLM了,用ViT密集补丁特征直接训练,速度更快、参数量少99.3%,性能还涨18%。想轻量高效做具身策略的可以看这篇。