8月5日
10:20
10:20官方账号arXiv cs.AI@Fan Yang, Yuting Su, Xiaobo Wang, Yuncheng You, Fugui Fan, Yuting Wu, Minghui Wu, Chenxu Zhao, JiaHong Ning, Peiguang Jing
LiLa-WAM在紧凑潜在空间中推理未来场景,可在单个24GB GPU上端到端训练,避免像素空间法的高开销。其核心是联合塑造的未来状态预测与动作生成机制,并提出了语言无关的视觉转换标记(VTT)作为任务表征。在RoboTwin 2.0的50个任务中取得90.48%成功率,且同时在LIBERO和真实机器人任务上验证了有效性。
推荐理由:LiLa-WAM用一张24GB显卡就能训练,在RoboTwin 2.0上50个任务做到90%以上成功率,还不用语言标注任务,做机器人操控的值得看看。
7月7日
11:36
11:36官方账号arXiv cs.AI@Jiaqi Peng, Xiqian Yu, Delin Feng, Yuqiang Yang, Wenzhe Cai, Jing Xiong, Ganlin Yang, Jinliang Zheng, Jiafei Cao, Xueyuan Wei, Jiangmiao Pang, Yuan Shen, Tai Wang
Cortex是一个双向对齐的体现代理框架,通过将操作子任务标准化为32个规范技能原语,并结合可执行性约束(如对象属性和轨迹可达性)自动标注4000+小时开源视频数据并生成30小时模拟数据。在Libero-long和RoboTwin基准上,Cortex分别比单一VLA模型提升3.1%和4.1%。其通用VLM与微调VLA结合,能零样本完成未见过的真实世界长程任务(如多阶段化学实验),而这单靠VLA微调无法实现。
推荐理由:Cortex把长程操作拆成32个标准动作,用开放数据自动训练,比纯VLA模型在Libero和RoboTwin上高3-4%,还能零样本做化学实验。
6月9日
13:07
13:07官方账号arXiv cs.AI@Jisong Cai, Long Ling, Shiwei Chu, Zhongshan Liu, Jiayue Kang, Zhixuan Liang, Wenjie Xu, Yinan Mao, Weinan Zhang, Xiaokang Yang, Ru Ying, Ran Zheng, Yao Mu
AHA-WAM是一种基于双扩散Transformer(DiT)架构的异步世界-动作模型,用于机器人操控。它通过将世界预测和动作执行解耦到不同时间分辨率,解决了传统模型在近端帧建模上的冗余问题。视频DiT作为低频世界规划器,维护滚动键值记忆并编码长期场景演化;动作DiT作为高频执行器,通过层间联合注意力查询世界上下文。实验在RoboTwin和真实世界任务中达到92.80%和78.3%的成功率,闭环控制频率达24.17 Hz,速度提升4.59倍,且无需机器人数据预训练。
推荐理由:机器人操控研究者终于有了一个能高效解耦世界建模与动作执行的方案——AHA-WAM在速度和成功率上双赢,做具身智能的团队可以直接参考其异步架构设计。