Dyna Robotics 拿 170 年人类视频训了个机器人模型,成功率能到九成,比上代翻倍,搞具身智能的值得看看。
Dyna Robotics 发布机器人基础模型 DYNA-2,预训练数据超过 100 万小时第一人称人类视频,相当于 170 年人类经验。该模型被称为世界动作模型,通过预测下一帧画面和动作来学习空间关系与接触物理。在 15 项基准任务中,随着预训练数据增加,任务成功率从约 20% 提升至 80% 到 90%。一次客户部署中,DYNA-2 质量通过率达 87%,而上一代 Dyna-1 为 46%。
机器人 AI 模型 DYNA-2 登场:超 100 万小时人类视频训练,任务成功率可达 90%
IT之家 8 月 13 日消息,具身智能公司 Dyna Robotics 最新发布机器人基础模型 DYNA-2, 基于超过 100 万小时的第一人称人类视频训练,任务成功率高达 90%。 定位方面,DYNA-2 官方描述为世界动作模型(World Action Model),目标是通过观察人类活动,学习动作如何改变物理世界。IT之家附上相关截图如下: 训练方面,DYNA-2 预训练完全依赖人类视频数据,规模超过 100 万小时第一人称人类视频,相当于 170 年人类经验。 公司联合创始人 Jason Ma 表示,通用机器人长期受限于数据瓶颈,人工采集物理遥操作数据难以扩展到通用智能,而 DYNA-2 模型通过观察人类活动来学习动作如何改变物理世界。 该公司认为,DYNA-2 在采取动作前先预测物理世界如何运动,可为机器人补足传统视觉语言模型(vision-language models)缺少的空间推理和接触物理能力。 该模型通过预测下一帧视频画面的内容以及应采取的动作两项训练目标,从而获取空间关系、运动方式以及物体受到接触后如何响应等方面的信息。 Dyna Robotics 公布的结果显示,随着预训练阶段加入更多人类视频数据,机器人在 15 项基准任务中的表现提升。该公司将这一现象称为人到机器人的缩放规律,并称性能会随着训练数据规模扩大而以相对可预测的方式增长。 在 1 项实验中,13 分钟机器人专用数据足以让 2 只 5 指机器人手学会拧开瓶盖。制造任务方面,在后训练数据集不变的情况下,成功率随着预训练规模增加,从约 20% 提升至 80% 到 90%。 Dyna Robotics 还称,Dyna-2 在 1 次客户部署中取得 87% 质量通过率,而上一代 Dyna-1 为 46%。在需要根据用户指令执行不同动作的任务中,视频协同训练让得分提升 133%。