Perceptron发了Egocentric API,能把机器人视频拆成最小动作单元并追踪每根手指,比基于Gemini的方案还要准。训练机器人手部操作就靠它了。
Perceptron AI发布Egocentric API,能将机器人操作视频拆解为最小动作单元(如伸手、抓起、放下),每个动作附带文字说明。该工具精确追踪双手,区分左右手,甚至标注单个手指动作。在Gemini 3.5 Flash和Gemini Robotics-ER 1.6的标注流水线对比中达到SOTA。它专供手部动作理解,对训练机器人操作关键。
兄弟们,这个好,而且感觉用处很多 Egocentric API:视频“翻译和拆解”工具 以前你给机器人一段操作视频(比如它怎么抓东西、怎么放东西),它只能看个大概,用这个之后,它能把这段视频拆得非...
兄弟们,这个好,而且感觉用处很多 Egocentric API:视频“翻译和拆解”工具 以前你给机器人一段操作视频(比如它怎么抓东西、怎么放东西),它只能看个大概,用这个之后,它能把这段视频拆得非常细: - 把一整段动作拆成一个个最小的动作单元(比如:伸手 → 抓起 → 抬起 → 移动 → 放下) - 每个小动作还给你打上清楚的文字说明 最牛的是,它能精确追踪两只手,知道哪只手在干什么,甚至能标出每个手指的动作 相当于给机器人视频做了一次超级精细的字幕 + 动作分解。 它跟别人有什么不一样? 现在市面上很多 AI也能看视频,但它们主要是“看画面猜”。而 Perceptron 这个东西把手当成了核心: 它特别擅长理解手怎么动的 能区分左手和右手 能知道手什么时候碰到东西、什么时候松开 这些信息对训练机器人特别重要,因为机器人最难学的就是“手怎么操作物体” 它不是在“看视频”,是能“理解手的动作”,并学习... Perceptron AI @perceptroninc We’re launching the first in a series of Embodied Reasoning offerings: Perceptron Egocentric. It achieves SOTA over the best robotic annotation pipelines built on Gemini 3.5 Flash and Gemini Robotics-ER 1.6. Early access is available to partners. Your browser does not support the video tag. 🔗 View on Twitter 🔗 View Quoted Tweet 💬 2 🔄 0 ❤️ 1 👀 649 📊 2 ⚡