7月8日
10:16
10:16官方账号arXiv cs.LG@Ryuji Oi, Hikari Otsuka, Kosuke Matsushima, Yuki Ichikawa, Masato Motomura, Tatsuya Kaneko, Daichi Fujiki
论文提出ActionCache,一种即插即用的外部缓存,用于加速基于流匹配的视觉-语言-动作(VLA)模型推理。ActionCache通过存储紧凑多模态键的中期动作,从相似过往上下文(跨不同回合甚至任务)中检索来预热生成,减少迭代去噪步骤。在仿真和真实环境实验中,ActionCache在低延迟下保持高任务成功率,对π₀.₅和GR00T-N1.6分别实现高达11.75倍和34.43倍的推理加速。
推荐理由:这篇论文用缓存中间动作的思路让VLA模型推理快11到34倍,而且不用重新训练,机器人实时控制场景很实用。
6月11日
10:08
10:08官方账号arXiv cs.LG@Balázs Gyenes, Emiliyan Gospodinov, Jan Frieling, Enrico Krohmer, Nicolas Schreiber, Xiaogang Jia, Niklas Freymuth, Gerhard Neumann
精选
该研究提出将点云从笛卡尔空间映射到高维傅里叶空间,以解决神经网络在模仿学习中难以学习高频空间特征的问题。在 RoboCasa 和 ManiSkill3 基准测试以及真实机器人实验中,傅里叶特征显著提升了基于点云的策略在精细操控任务上的表现。该方法简单、鲁棒,且适用于多种编码器架构,有望成为点云模仿学习的通用工具。
推荐理由:做机器人操控和模仿学习的团队值得关注——傅里叶特征解决了神经网络对低频偏好的固有问题,让你在点云策略上直接获得高精度提升,代码和视频已开源,可以直接上手试。
6月9日
13:07
13:07官方账号arXiv cs.AI@Jisong Cai, Long Ling, Shiwei Chu, Zhongshan Liu, Jiayue Kang, Zhixuan Liang, Wenjie Xu, Yinan Mao, Weinan Zhang, Xiaokang Yang, Ru Ying, Ran Zheng, Yao Mu
AHA-WAM是一种基于双扩散Transformer(DiT)架构的异步世界-动作模型,用于机器人操控。它通过将世界预测和动作执行解耦到不同时间分辨率,解决了传统模型在近端帧建模上的冗余问题。视频DiT作为低频世界规划器,维护滚动键值记忆并编码长期场景演化;动作DiT作为高频执行器,通过层间联合注意力查询世界上下文。实验在RoboTwin和真实世界任务中达到92.80%和78.3%的成功率,闭环控制频率达24.17 Hz,速度提升4.59倍,且无需机器人数据预训练。
推荐理由:机器人操控研究者终于有了一个能高效解耦世界建模与动作执行的方案——AHA-WAM在速度和成功率上双赢,做具身智能的团队可以直接参考其异步架构设计。