15:32官方账号arXiv cs.AI@Bingxin Xu, Yuzhang Shang, Emilio Ferrara精选BATON是一种针对长时程机器人操作的新方法,通过将探索单元从整个任务细化为子任务,使成本从指数级降为线性。它引入了过渡感知记忆,包括验证器、交接和前瞻机制,以处理子任务间的状态转换。在RoboMemArena基准上,BATON将任务成功率提升了11.6%,累计成功率提升了14.9%。该方法无需更新参数,仅通过语言记忆和智能体协作实现。论文BATON机器人操作VLA模型推荐理由:BATON解决了长时程机器人操作中错误累积和子任务衔接的难题,成功率提升明显,值得一看。原文稍后读已读值得跟进有用关注 BATON
19:54IT之家(博客/媒体)73°2026年WAIC于7月17日开幕,腾讯Robotics X实验室首次公开“小六”机器人。“小六”是2024年9月发布的“小五”的迭代,采用四腿轮足复合设计,并新增键绳传动技术。该实验室联合越疆科技,在真实产线上完成VLA模型训练部署,任务成功率超过95%。大会展览面积超10万平方米,1100余家企业参展,300余款产品全球首发。AI产品腾讯Robotics X小六越疆科技推荐理由:腾讯发了新一代机器人“小六”,相比“小五”在键绳传动和灵巧操作上更先进,还在WAIC现场展示了。想了解轮足机器人最新进展可以看看。原文稍后读已读值得跟进有用关注 腾讯Robotics X
11:08官方账号arXiv cs.AI@Dong Jing, Tianqi Zhang, Jiaqi Liu, Jinman Zhao, Zelong Sun, Li Erran Li, Zhiwu Lu, Mingyu Ding本文提出在两阶段框架中预训练动作模块,在VLA训练前注入运动先验。阶段1使用基于流匹配的轻量级编解码器,仅从无条件动作轨迹学习跨实体时间运动结构,无需处理视觉或语言token。阶段2通过解码器重用和早期潜在蒸馏,将学习到的先验迁移至VLA训练,同时保留端到端优化。在13个仿真和真实世界的跨实体任务中,该方法比无先验的VLA训练收敛更快、成功率更高,尤其数据稀缺时表现更优。扩展阶段1的动作数据能提升下游VLA性能的泛化性。论文Cross-embodimentVLA模型机器人操作推荐理由:这篇论文教VLA模型在正式训练前先学动作规律,用的是流匹配,13个任务上效果比直接训练好,数据少时尤其明显。原文稍后读已读值得跟进有用关注 Cross-embodiment
09:37官方账号arXiv cs.AI@Bochen Yang, Lianlei Shan精选PearlVLA提出一种将动作规划调度到VLM潜在空间的新框架,通过将元查询表示分为视觉定位分支和迭代潜在规划分支,利用冻结的潜在世界模型生成未来观测,并经过K轮细化后并行解码动作块。在LIBERO基准上,PearlVLA达到了现有方法中的最佳性能,证明了潜在空间推理在降低延迟的同时提升规划质量的有效性。AI模型PearlVLAVLA模型具身智能推荐理由:这篇论文提出了PearlVLA,把动作规划放到了潜在空间里,比传统文本链式推理延迟更低,在LIBERO上刷了SOTA,做具身智能的可以看看。原文稍后读已读值得跟进有用关注 PearlVLA
12:16官方账号arXiv cs.LG@Wei Xiao, Weiliang Tang, Yuying Ge, Hui Zhou, Yao Mu, Li Zhang, Yixiao GeROVE 是一个用于人形机器人视觉-语言-动作(VLA)模型后训练的强化学习框架,能够应对不完美的人类干预数据。它引入人类在环流水线收集部署与干预数据,并使用乐观价值估计(OVE)从混合质量轨迹中筛选高价值行为。ROVE 还利用跨实体人类经验视频为长尾失败与恢复模式提供丰富监督,引导 VLA 聚焦于高价值行为。在真实世界的接触丰富且精细的人形操作任务中,ROVE 超越了经验学习基线,并在多轮部署-干预迭代中持续提升。AI模型ROVE人形机器人强化学习推荐理由:人形机器人操作新方法ROVE,用强化学习从糟糕的人类演示中挑出好动作,真实任务效果比基线好。原文稍后读已读值得跟进有用关注 ROVE
10:09官方账号arXiv cs.AI@Baochang Ren, Xinjie Liu, Xi Chen, Yanshuo Liu, Chenxi Li, Daqi Gao, Zeqin Su, Jintao Xing, Zirui Xue, Rui Li, Xiangyu Zhao, Shuofei Qiao, Minting Pan, Wangmeng Zuo, Lei Bai, Dongzhan Zhou, Ningyu Zhang, Huajun Chen现有AI能读文献、写假设、规划实验方案,但实际动手操作仍需人类。LabVLA提出将视觉-语言-动作模型(VLA)应用于科学实验室场景,解决现有模型只在家庭和桌面场景训练、无法处理实验室仪器和透明液体等特殊问题。研究团队构建了RoboGenesis仿真数据引擎,生成实验室专用训练数据,并设计了LabVLA模型,采用两阶段训练:先用FAST动作标记预训练让模型具备动作感知能力,再用流匹配后训练附加动作专家模块。在LabUtopia基准测试中,LabVLA在分布内和分布外场景下均取得最高平均成功率。这项工作为机器人自主执行科学实验提供了可行路径。论文VLA模型科学实验室机器人操作推荐理由:做机器人操作或科学自动化的团队终于有了实验室场景的专用VLA方案——LabVLA解决了数据稀缺和模型适配两大瓶颈,在仿真基准上表现领先,值得关注其后续实物部署进展。原文稍后读已读值得跟进有用关注 VLA模型
12:33官方账号arXiv cs.AI@Chuanke Pang, Junyi Huang, Zhijun Zhao, Yaobing Wang, Kun Xu, Xilun Ding精选VLA模型在机器人操作中展现出强大的零样本泛化能力,但现有预训练管线几乎都局限于低自由度平行夹爪。将语义先验迁移到高自由度灵巧手面临严重的形态鸿沟,直接端到端微调会导致空间推理灾难性遗忘和动作流形坍塌。本文提出InDex框架,通过跨形态语义继承,将预训练的1-DoF平行抓取输出重新用作连续的宏观虚拟抓取意图代理,并采用两阶段解耦学习架构:第一阶段参数高效对齐VLA骨干以预测连续手臂轨迹和标量抓取意图;第二阶段冻结空间骨干,利用意图条件去噪扩散头解码多指末端执行器的细粒度关节动作。在多种多阶段、高接触灵巧操作任务上的仿真基准测试表明,InDex能以极少的演示数据掌握复杂技能,显著优于整体微调基线,同时保留原始VLA先验的鲁棒空间泛化能力。论文VLA模型灵巧操作形态鸿沟推荐理由:机器人操作研究者终于有了解决灵巧手形态鸿沟的实用方案——InDex用意图条件微调避免了灾难性遗忘,做灵巧操作或VLA模型迁移的团队可以直接参考其两阶段架构。原文稍后读已读值得跟进有用关注 VLA模型
11:02官方账号arXiv cs.AI@Ria Doshi, Tian Gao, Annie Chen, Chelsea Finn, Jeannette Bohg多机器人协作在移动场景中面临扩展性差和部分可观测性问题。CHORUS框架利用预训练视觉-语言-动作(VLA)模型的视觉运动先验,使每个机器人仅依赖自身局部观测和身份提示即可独立运行,无需推理时通信或显式对齐。在移动测量、图书交接和洗衣篮搬运等真实实验中,CHORUS相比从零训练的分散模型提升64%性能,对队友行为的反应性提高40%,并超越集中式基线。该工作表明,共享VLA骨干网络足以实现去中心化多机器人协作,无需为每个机器人单独训练策略。论文多机器人协作VLA模型去中心化推荐理由:多机器人协作的扩展性难题被VLA模型破解了——做机器人集群部署的团队可以直接参考CHORUS的零通信方案,省去复杂的对齐和通信模块。原文稍后读已读值得跟进有用关注 多机器人协作
10:05官方账号arXiv cs.LG@Hyun Joe Jeong, Gokul Swamy, Andrea Bajcsy精选该研究提出一种框架,通过交互式搜索语言序列来提升视觉-语言-动作(VLA)模型的闭环任务性能,并蒸馏为测试时的语言反馈策略(LFP)。同时学习一个改进头,预测何时语言引导能提升性能,并通过保形化处理防止有害干预。该方法适用于任意冻结的预训练VLA模型,无需访问原始训练数据或微调。在模拟和硬件实验中,该策略分别将基础VLA性能提升24.7%和65.0%,且在视觉和语义扰动下具有强无害性保证。论文VLA模型语言引导机器人控制推荐理由:机器人开发者终于有了一个无需重新训练就能安全引导VLA模型的方法——通过语言反馈策略提升任务成功率,同时避免有害行为。做机器人控制或人机交互的团队可以直接在现有模型上尝试,值得关注。原文稍后读已读值得跟进有用关注 VLA模型
12:29官方账号arXiv cs.AI@Taishan Li, Jiwen Zhang, Siyuan Wang, Xuanjing Huang, Zhongyu Wei精选现有视觉-语言-动作(VLA)模型在标准操作基准上表现优异,但大多假设任务相关物体完全可见,这在现实场景中常因遮挡而失效。研究者提出LIBERO-Occ,一个基于LIBERO的遮挡扩展基准,发现当前最先进的VLA模型在遮挡下性能显著下降。为解决此问题,他们提出视角想象(VIM)方法,从遮挡的主视角生成互补视角,并基于观测和想象证据联合预测动作。VIM无需额外部署摄像头即可提升模型在多种任务、遮挡类型和严重程度下的鲁棒性。该基准和代码已开源。论文VLA模型遮挡鲁棒性视角想象推荐理由:做机器人操作或VLA模型研究的团队,终于有了专门评估遮挡鲁棒性的基准和解决方案——VIM用视角想象补全感知,无需加摄像头就能提升性能,值得一试。原文稍后读已读值得跟进有用关注 VLA模型
12:30官方账号arXiv cs.LG@Seongbin Park, Fan Zhang, Baharan Mirzasoleiman, Shahriar Talebi, Nader Sehatbakhsh精选VLA模型在机器人操作任务中表现出色,但无法保证避免与任务无关物体的碰撞。现有安全过滤器通过查询VLM来识别障碍物,但速度太慢,无法在控制循环中实时运行。研究发现,VLA模型中的少数注意力头能可靠定位策略意图接近的目标物体。利用这些注意力头,可以在无需训练的情况下,每步获取活动目标,将场景其余部分视为障碍物,并输入控制障碍函数过滤器。结合轻量级实时目标跟踪器,该方法能有效避免非静态障碍物的碰撞,在动态场景中比使用模拟器特权状态的Oracle方法平均提升43%。论文VLA模型安全过滤器注意力机制推荐理由:做机器人安全控制的团队终于有了一个轻量级方案——VLA模型自带的注意力头就能当安全过滤器用,无需额外训练或重模型,动态场景效果还更好,值得点开看实现细节。原文稍后读已读值得跟进有用关注 VLA模型
09:47官方账号arXiv cs.AI@Yuan Zhang, Shiqi Zhang, Yedong Shen, Shuai Dong, Jiajun Deng, Xin Zhang, Yuxuan Gao, Jiajia Wu, Xin Nie, Zhiyuan Cheng, Jianmin Ji, Yanyong Zhang, Xingyi Zhang, Jia Pan精选72°GEAR-VLA 是一种新型视觉-语言-动作(VLA)框架,旨在解决现有 VLA 模型在真实部署中面对未见物体、背景变化和不同机器人本体时的泛化问题。它通过粗到细的动作学习、语义对齐的 3D 特征融合以及本体规范化,学习统一的几何感知动作表征。在 LIBERO、零样本 LIBERO-Plus 和 RoboTwin 2.0 上达到最先进性能,在 AgileX 上成功率 85.9%,在未见本体 LDT-01 上达 81.0%,在 212 个未见物体的通用抓取基准上达 90.1%。代码和模型将开源。论文机器人操作VLA模型泛化推荐理由:GEAR-VLA 解决了机器人操作中跨本体、跨场景泛化的核心痛点,做机器人操作研究的团队可以直接参考其粗到细动作学习与 3D 对齐方法,值得关注其开源代码。原文稍后读已读值得跟进有用关注 机器人操作
13:05IT之家(博客/媒体)精选76°英伟达发布 Alpamayo 2 Super,一款 320 亿参数的视觉-语言-动作(VLA)开源模型,专为 L4 自动驾驶研发设计。该模型具备类人感知、推理与行动能力,支持全车环视感知和元动作输出,可免去企业从零搭建核心基础设施。英伟达同步推出 AlpaGym 闭环强化学习平台、OmniDreams 世界模型等工具,打通从数据采集到车载部署的全流程。模型定位为教师模型,可通过知识蒸馏部署在 DRIVE AGX Thor 芯片上,已获比亚迪、吉利等车企采用。推理代码预计夏季开源。AI模型英伟达Alpamayo 2 Super自动驾驶推荐理由:英伟达把自动驾驶模型参数翻了三倍,还开源了全套工具链,做 L4 研发的团队可以直接省掉从零搭建的环节,建议关注夏季开源代码。原文稍后读已读值得跟进有用关注 英伟达
11:58官方账号arXiv cs.LG@Xinyu Wang, Mingze Li, Sicheng Lyu, Dongxiu Liu, Kaicheng Yang, Ziyu Zhao, Yufei Cui, Xiao-Wen Chang, Peng Lu精选Ω-QVLA是首个无需训练的后训练量化框架,能将视觉-语言-动作模型的语言骨干和扩散动作头统一压缩至W4A4精度,打破此前认为动作头必须混合精度的认知。它通过复合SVD-Hadamard旋转均衡权重能量并分散激活异常值,结合逐步骤的DiT激活缩放量化吸收去噪步间的动态范围漂移。在LIBERO基准上,Pi 0.5和GR00T N1.5经量化后任务成功率分别达98.0%和87.8%,与FP16参考值持平或略优,静态内存占用降低71.3%。真实机器人操作实验也验证了其流畅精准的控制能力。代码已开源。论文量化VLA模型Pi 0.5推荐理由:做机器人或边缘部署VLA模型的团队终于有了统一量化方案——内存省71%且性能不降,Pi 0.5和GR00T N1.5用户可以直接用代码复现。原文稍后读已读值得跟进有用关注 量化
10:34官方账号arXiv cs.AI@Xintong Hu, Xuhong Huang, Jinyu Zhang, Yutong Yao, Yuchong Sun, Qiuyue Wang, Mingsheng Li, Sicheng Xie, Yitao Liu, Junhao Chen, Yixuan Chen, Yingming Zheng, Shuai Bai, Tao Yu精选72°现有机器人数据集通常只提供粗粒度的目标级语言描述,缺乏执行细节(如活动臂、接近方向、接触区域),限制了策略的可操控性。FineVLA 提出了一个开放框架,包括数据构建工具、细粒度数据集 FineVLA-Data(47,159 条轨迹)、基准测试、专用 VLM 标注器和可操控策略。实验表明,细粒度监督不仅不牺牲目标级成功率,还能提升 1.4-8.1 个百分点,且与粗粒度指令互补,最佳混合比例(FG:Raw=1:2 至 1:1)在仿真和真实场景中均取得最高性能。细粒度监督在姿态、颜色和接近方向等关键因素上带来最大真实世界增益,建议用细粒度语言补充目标级指令。论文VLA模型细粒度指令机器人策略推荐理由:做机器人策略学习和 VLA 模型的研究者终于有了可用的细粒度数据框架——FineVLA 不仅开源了 47K 条验证轨迹和基准,还证明了细粒度指令能显著提升操控精度,做双臂操作或仿真迁移的团队可以直接用。原文稍后读已读值得跟进有用关注 VLA模型
11:13官方账号arXiv cs.LG@Zhuohang Li, Liqun Huang, Wei Xu, Zhengming Zhu, Nie Lin, Xiao Ma, Xinjun Sheng, Ruoshi Wen精选Vision-Language-Action (VLA) 模型在灵巧操作中容易因高维动作空间和接触丰富的动力学产生累积误差。现有交互式模仿学习(IIL)在接管时存在人机指令不匹配,导致机器人手部“手势跳跃”。Hand-in-the-Loop (HandITL) 提出一种无缝干预方法,将人类纠正意图与自主策略执行融合,避免手势跳跃。实验表明,相比直接遥操作接管,HandITL 减少接管抖动 99.8%,降低抓取失败率 87.5%,平均完成时间缩短 19.1%。在三个长时灵巧任务上,用 HandITL 收集的干预数据训练的策略平均性能提升 19%。论文灵巧操作VLA模型人机交互推荐理由:灵巧操作是机器人领域的硬骨头,HandITL 解决了人机干预时的“手势跳跃”痛点,做机器人操作或 VLA 模型微调的团队可以直接参考实验方法,减少训练数据收集中的噪声。原文稍后读已读值得跟进有用关注 灵巧操作