事件专题 ·单一信源

Long-WAM:扩展世界-动作模型上下文,实时机器人控制成功率提升至 78.7%

Long-WAM 是一个用于扩展因果世界-动作模型上下文的模型-系统框架,核心发现是视频基座采用自回归预训练时,更长历史才真正带来收益。在 RoboCasa GR-1 基准上,上下文从 0.0 秒增加到 19.2 秒,成功率从 63.3% 提升到 78.7%,而双向预训练初始化没有净增益。Long-WAM 在 LIBERO-Long、RoboTwin 2.0 和 DOMINO 上取得对比方法中的最佳结果,RTX 5090 上每个动作块耗时 107.4 毫秒。实际部署在 Unitree G1 和 YAM 上,动态杯子堆叠任务成功率达 95%,而 Pi0.5 和 Fast-WAM 在 20 次试验中全部失败。

当前结论

这篇论文把机器人模型的历史上下文拉到 19.2 秒,动态杯子堆叠做到 95% 成功,Pi0.5 一个都做不成,方法细节写得很清楚。

2 个信源53° AI 热度最后更新 2026/10/7 17:58:04

证据链

2 个信源
相关来源 1Aran Komatsuzaki (论文推介)
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。