8月20日
10:14
8月18日
15:25
15:25官方账号arXiv cs.AI@Langzhe Gu, Chengkai Hou, Meng Li, Xinhua Wang, Jiaming Liu, Xinyuan Lv, Bowei Zhang, Shuanghao Bai, Guangrun Li, Jingyang He, Gaole Dai, Ziluo Ding, Zhiyuan Xu, Kuan Cheng, Jian Tang, Zhengping Che, Shanghang Zhang
HAF框架包含HAF-VLA和HAF-Steer两部分,将预训练的流匹配VLA模型适配到人形机器人全身操作。HAF-VLA通过三阶段动作去噪和跨阶段KV缓存,协调行走、腰姿和双臂操作。HAF-Steer利用流匹配可逆性和DCT降维,在紧凑噪声子空间训练SAC策略,避免更新大型VLA骨干。在7个真实世界人形操作任务中,HAF优于单阶段VLA基线,提升全身协调性和任务性能。
推荐理由:人形机器人全身操作一直难搞,HAF把通用VLA拆成三阶段动作流,再用DCT降维做在线强化学习,7个真实任务都跑赢了基线。
8月4日
09:36
09:36官方账号arXiv cs.AI@Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu Zhu
WAM-Diff2是一种多任务离散扩散VLA框架,通过三阶段分层蒸馏将预训练自回归模型转化为并行扩散模型。该方法解决了自回归解码的高延迟和暴露偏差问题,同时保留多任务视觉-语言推理能力。在驾驶理解、感知和规划基准上,WAM-Diff2与自回归基线性能持平。推理加速达2.8倍,结合FlashInfer和CUDA Graphs系统优化后最高可达15.1倍。
推荐理由:它把慢吞吞的自回归VLA模型变成并行扩散模型,性能不掉,推理快2.8倍,还能跑自动驾驶多任务。
7月30日
7月26日
16:12
16:12官方一手pandaily@contact@pandaily.com (Pandaily)
腾讯 Robotics X 在 WAIC 2026 上开源三个具身基础模型:VLM 负责场景理解,RxBrain 认知模型基于视觉状态进行规划,VLA 连续动作控制频率达 500-1000Hz。首席科学家张正友解释了三层大脑架构,解决了机器人反应速度问题。这些模型分别对应感知、认知和动作层,可组合用于复杂操作任务。

推荐理由:腾讯开源了三个具身模型,像搭积木一样分层解决机器人从看懂到动起来的难题,VLA 能做到毫秒级反应,做机器人开发的一定要看看。
7月20日
09:22
09:22官方账号arXiv cs.AI@Haoran Sun, Wentao Zhang, Junyang Hua, Hedan Yang, Yongjian Guo, Yifei Zhang, Xiaolong Xiang, Mingxi Luo, Jing Long, Chen Zhao, Chen Zhou, Wanting Xu, Qiming Yang, Hui Zhang, Song Wang, Xiaodong Bai, Shuai Di, Xu Chu, Xiaotie Deng, Yicheng Gong, Junwu Xiong
JoyNexus是一个统一服务,支持多租户VLA模型的监督微调、强化学习和评估。它通过解耦Training Model Service、Inference Model Service和Environment Service,租户通过API调用。采用group batching技术,使不同VLA数据模式共享一个前向传播,提升训练效率。实验表明,相比单租户独立执行,JoyNexus减少了总GPU时间并提高了服务利用率。
推荐理由:做VLA模型微调或机器人仿真的团队可以看看,JoyNexus用分组批处理省GPU资源,多租户场景下效率更高。
7月19日
11:42
7月16日
7月8日
10:16
10:16官方账号arXiv cs.LG@Ryuji Oi, Hikari Otsuka, Kosuke Matsushima, Yuki Ichikawa, Masato Motomura, Tatsuya Kaneko, Daichi Fujiki
论文提出ActionCache,一种即插即用的外部缓存,用于加速基于流匹配的视觉-语言-动作(VLA)模型推理。ActionCache通过存储紧凑多模态键的中期动作,从相似过往上下文(跨不同回合甚至任务)中检索来预热生成,减少迭代去噪步骤。在仿真和真实环境实验中,ActionCache在低延迟下保持高任务成功率,对π₀.₅和GR00T-N1.6分别实现高达11.75倍和34.43倍的推理加速。
推荐理由:这篇论文用缓存中间动作的思路让VLA模型推理快11到34倍,而且不用重新训练,机器人实时控制场景很实用。
7月7日
11:36
11:36官方账号arXiv cs.AI@Jiaqi Peng, Xiqian Yu, Delin Feng, Yuqiang Yang, Wenzhe Cai, Jing Xiong, Ganlin Yang, Jinliang Zheng, Jiafei Cao, Xueyuan Wei, Jiangmiao Pang, Yuan Shen, Tai Wang
Cortex是一个双向对齐的体现代理框架,通过将操作子任务标准化为32个规范技能原语,并结合可执行性约束(如对象属性和轨迹可达性)自动标注4000+小时开源视频数据并生成30小时模拟数据。在Libero-long和RoboTwin基准上,Cortex分别比单一VLA模型提升3.1%和4.1%。其通用VLM与微调VLA结合,能零样本完成未见过的真实世界长程任务(如多阶段化学实验),而这单靠VLA微调无法实现。
推荐理由:Cortex把长程操作拆成32个标准动作,用开放数据自动训练,比纯VLA模型在Libero和RoboTwin上高3-4%,还能零样本做化学实验。
6月25日
10:59
10:59官方账号arXiv cs.AI@Shuyi Zhang, Yunfan Lou, Hongyang Cheng, Yichen Guo, Chuyao Fu, Yaoxu Lyu, Xiaojie Zhang, Haoran Li, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang
FORCE是一个三阶段框架,通过价值校准热身和自蒸馏来稳定VLA模型的强化学习微调。它解决了Q函数不稳定导致的初期遗忘和低质量探索数据导致的策略更新低效问题。在模拟和真实任务上,FORCE取得了79%的绝对成功率提升,比此前RL方法高出10%,同时训练速度加快32.5%。该框架无需人工干预即可实现稳健性能。
推荐理由:新框架FORCE让机器人学动作更快更稳,成功率飙升79%,比现有RL方法还快32.5%,不用人插手。
6月19日
10:12
10:12官方账号arXiv cs.AI@Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha, Khoa Vo, Philip Lund Møller, Quang T. Nguyen, Long Dinh, Tuan Dam, Vu Duong, Tung M. Luu, Trung Le, Tran Nguyen Le, Minh Vu, An Thai Le, Ngan Le, Daniel Sonntag, James Zou, Jan Peters, Duy M. H. Nguyen, Ngo Anh Vien
VLA模型(如pi_0、GR00T-N1.5)参数规模达数十亿,微调计算成本高。本文通过中心核对齐(Centered Kernel Alignment)识别冗余层,无需训练即可移除最多50%的层。在LIBERO、RoboCasa、SimplerEnv三个模拟基准和10个真实操作任务、4种机器人本体上验证,压缩后模型性能与完整模型相当。微调时间减少40-50%,实时推理速度提升达30%。结果表明VLA模型实际所需层数远少于现有架构。
推荐理由:这篇论文发现VLA模型很多层是冗余的,用他们的方法可以白嫖50%层数,微调快一半,推理快30%,效果不降。搞机器人微调的可以试试。
6月18日
10:57
10:57官方账号arXiv cs.LG@Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, Denis Shepelev, Andrey Kuznetsov, Elena Tutubalina, Aleksandr I. Panov, Alexey K. Kovalev, Vlad Shakhuro
论文提出 Act2Answer 协议,通过让智能体在桌面场景中执行物体放置动作来选择答案,从而在动作层面评估 7 个 VLA 模型和 9 个 VLM 基线在常识与知识任务上的表现。研究发现,VLA 在简单概念上表现扎实,但在丰富语义类别上相比源 VLM 出现更大差距。实验还表明,VQA 联合训练有助于提升知识保留,而答案相关信息在 VLA 中层达到峰值,上层则衰减。
推荐理由:想知道微调后的机器人模型到底还记不记得常识?这篇论文用动作答题的方式测了7个VLA,发现简单概念还行,复杂知识掉得厉害。
5月21日