#VLA
一篇机器人方向的新论文:给 VLA 模型加了个多样性奖励来做 RL 微调,π_0 分布外成绩提了 5.3 分,真机上成功率也从 64% 涨到 73%。
想让机器人从人类视频里学技能的可以看看这篇,EgoLAP 不硬抄人类动作,改成学语言化的动作意图,真实任务进度做到 80.1%,比其他表示高 2.3 倍。
一篇 VLA 训练新论文,思路挺巧:同一批数据换个揭示顺序当正则,LIBERO 和 CALVIN 上都有提升,做机器人策略的可以看看。
Chelsea Finn 团队写了篇博客,讨论机器人怎么走 LLM 后训练的老路,还给出 EXPO-FT 方法,抓鸡蛋这类任务做到了 30 次全成功,只花 19 分钟真机交互。
给做机器人策略的人:MemBodied 用固定大小记忆替代越堆越长的上下文,RMBench 上成功率达到无状态策略的 7.81 倍,参数开销还小 10 倍。
Wayve 这篇论文教你怎么用不到5%的语言标注训出能开车的VLA,Bench2Drive 上分数还超过全监督基线,做自动驾驶的值得看看方法细节。
机器人换个机位就翻车的问题有解了:InfiNoVA 用 3D Gaussian 造新视角训练数据,陌生视角成功率提升 5.4 倍,不用改模型架构。
中国移动搞了个叫 Open-RAIL 的东西,能让你把 VLA/WAM 模型装到不同机器人上,新机器人接入快,新模型接入也快,还提升了动作平滑度。
小鹏汽车推出第二代 VLA 全新版本,支持更高级别的自动驾驶,X-Foresight 预测世界模型和 Infini-VLA 长时序架构带来新体验,值得期待。
拿一个贴了纹理的物体就能让 OpenVLA 和 π0.5 的成功率从 90% 掉到 48%,还能跨模型生效,搞机器人安全的可以看看。
腾讯开源了三个具身模型,像搭积木一样分层解决机器人从看懂到动起来的难题,VLA 能做到毫秒级反应,做机器人开发的一定要看看。
招商局 LionRock AI Lab 搞了个新方法,专治 VLA 模型“只看局部不看整体”的空间视觉错觉,被 IROS 2026 收录,做具身智能的值得关注。