7月9日
15:00
11:53
11:53量子位@量子位的朋友们
量化派基于餐饮后厨场景的多模态数据,训练了物理世界基础模型Q-Phys-v1。该模型在Meta Habitat 2.0基准的物体抓取任务上达到88%成功率,在自主导航任务中路径规划效率提升40%。模型通过API和SDK向企业开放,支持场景定制。
推荐理由:量化派把餐饮后厨数据用到物理模型上,思路很落地,Q-Phys在机器人任务上表现不错,适合做机器人和自动驾驶的公司看看。
03:03
03:03官方账号Allen AI (Ai2)@allen_ai
精选
Allen AI发布的MolmoAct 2是一个完全开放的视觉-语言-动作模型。机器人工程师@pham_blnh利用该模型在周末构建了语音控制机器人。这款机器人赢得了@southpkcommons举办的AI黑客马拉松。Allen AI还发布了相关采访视频。

推荐理由:Allen AI的MolmoAct 2开放模型,周末就能搭语音机器人,还赢了黑客马拉松,看采访视频了解细节。
7月8日
22:25
22:25量子位@思邈
RoboDojo新基准测试发布,人类表现100分,最强AI模型仅获12.8分。该基准包含200个具身智能任务,覆盖抓取、导航、操作等场景。当前模型在长时序任务和细粒度控制上明显落后于人类。测试揭示了机器人在泛化能力和物理交互方面的核心瓶颈。
推荐理由:RoboDojo这个新基准把人类和模型放到同一考场,人类满分100,最强模型才12.8,差距大到离谱,值得看看模型到底在哪栽跟头。
7月7日
13:11
13:11官方一手pandaily@contact@pandaily.com (Pandaily)
成立仅11个月的具身AI初创公司Simplexity Robotics宣布,其全场景机器人i7 Pro首批100台已交付至多个工业生产线。该机器人售价2.5万美元,具备自主导航和精细抓取能力,可替代3-4名产线工人。公司计划2026年底前再交付500台。

推荐理由:一家才 11 个月的初创公司,已经交付 100 台 i7 Pro 机器人到真实产线,效率惊人
11:55
11:55官方一手Pandaily@contact@pandaily.com (Pandaily)
具身AI初创公司Zhijian Dongli成立仅11个月,宣布向生产线交付首批100台全场景机器人i7 Pro。该机器人可用于工业制造等场景,标志着公司从研发到商业交付的快速推进。i7 Pro是该公司首款批量出货产品,此前已在测试环境中验证能力。
推荐理由:一家成立不到一年的公司,就交付了100台i7 Pro机器人到产线上,效率惊人。和那些还在画饼的同行比,这步走得挺实。
11:33
11:33官方账号arXiv cs.AI@Kaiyuan Chen, Shuangyu Xie, Letian Fu, Justin Yu, William Pacini, Sandeep Bajamahal, Hudson Kim, Jaimyn Drake, Daehwa Kim, Haoru Xue, Jonathan Francis, Christian Juette, Peter Schaldenbrand, Muhammet Yunus Seker, Ruwan Wickramarachchi, Uksang Yoo, Guanzhi Wang, Adithyavairavan Murali, Balakumar Sundaralingam, S. Shankar Sastry, Spencer Huang, Yuke Zhu, Linxi "Jim" Fan, Ken Goldberg
GaP(Graph-as-Policy)是一种多智能体编码框架,从模块化开放机器人技能库MORSL生成含感知、规划和控制节点的有向计算图。它构建内部仿真环境并行排练不同图结构的任务实例,迭代优化图结构与参数以提升成功率和吞吐量。在8个新开放VA任务基准(4个仿真、4个真实世界)上,GaP的成功率显著优于基线方法。论文、代码和数据已开源。
推荐理由:这篇论文提出GaP,把机器人编程的可靠性和模型无关策略的适应性结合起来,在8个变分自动化任务上吊打基线。做机器人任务规划的话值得一看。
7月4日
14:38
14:38官方一手marktechpost@Asif Razzaq
NVIDIA 发布了 ASPIRE 自改进机器人框架,能自动编写并优化机器人控制程序。该框架在 LIBERO-Pro 长任务上实现 31% 零样本成功率,并通过迭代修复将性能提升最多 77 点。ASPIRE 还能将已验证的修复技能蒸馏为可复用的技能库,支持零样本迁移到未见过的长时任务。
事件专题

推荐理由:NVIDIA 搞了个新框架 ASPIRE,自己写程序自己修,LIBERO-Pro 长任务零样本就 31%,还能再提 77 点,做机器人的可以看看。
01:02
01:02官方账号MIT CSAIL@MIT_CSAIL
MIT CSAIL提出Masked IRL方法,利用LLM解决机器人面对模糊指令的问题。该方法包含两个模型:一个用于澄清用户提示,另一个忽略无关信息。这使机器人能更准确执行含糊不清的任务如'把那个东西放好'。

推荐理由:机器人终于能听懂'把那个东西放好'这种模糊话了。MIT的Masked IRL用LLM先理清意图再干活,挺实用。
7月3日
11:25
11:25官方账号arXiv cs.AI@Yuquan Xue, Le Xu, Zeyi Liu, Zhenyu Wu, Zhengyi Gu, Xinyang Song, Bofang Jia, Ziwei Wang
WorldSample 提出一种物理基础的数据增强框架,通过世界模型生成高保真合成轨迹,解决真实机器人强化学习交互成本高的问题。在接触性和精密机器人操作任务中,WorldSample 将策略成功率提升 28%,训练步数减少 59%。世界模型视觉保真度提升 19.4dB PSNR 和 0.47 SSIM,验证了真实-合成循环的有效性。
推荐理由:机器人强化学习的新思路,WorldSample 用世界模型生成合成数据,成功率提28%还省了59%训练时间,值得一看。
04:03
04:03Stanford AI Lab@StanfordAILab
精选
斯坦福AI实验室提出Freeform Preference Learning方法,让标注者用自然语言描述轨迹的偏好轴(如速度、精度、子任务完成度),而非仅做单一整体偏好选择。该方法学习基于这些轴的奖励函数,能提取更优策略。论文arXiv:2606.32027和博客已公开。
推荐理由:斯坦福团队发了个新方法,让标注者用自然语言描述偏好,比单一打分更精确,机器人策略能学到更多结构信息。
7月2日
7月1日
03:28
03:28官方账号Runway ML@runwayml
Runway AI Summit将于今年9月在旧金山举办,为期一天。峰会汇集机器人、自动驾驶、生命科学、基础设施等行业领袖,探讨AI如何重塑现实世界互动。首批演讲者名单已公布,更多嘉宾待揭晓。活动现开放注册。
推荐理由:Runway在旧金山办AI峰会,主题是机器人、自动驾驶这些硬核领域,对AI落地感兴趣可以去听听。
6月30日
6月26日
10:52
10:52官方账号arXiv cs.AI@Junhao Shi, Zezheng Huai, Siyin Wang, Jia Chen, Yubang Wang, Zhaoye Fei, Hechang Chen, Jingjing Gong, Xipeng Qiu, Yu-Gang Jiang
OmniAct 提出了一个分层异步架构,将多模态语义规划器、基于事件边界压缩的自适应分层记忆和异步视觉抢占引擎模块化集成,以解决持久自主机器人的跨域工具调用与物理故障恢复问题。在40个真实世界长期任务中,使用两个机器人平台协调四个IoT设备,OmniAct在所有复杂度级别上端到端成功率一致提升,累积超过10万交互token时保持接近线性的token消耗,并让中等规模开源模型达到闭源模型性能。
推荐理由:他们搞了个新架构,让机器人能自己协调API、物联网和物理动作,干活出错还能自己恢复,20个任务里成功率都比之前高,而且省钱省token。
6月25日
16:21
16:21官方一手Pandaily@contact@pandaily.com (Pandaily)
RoboScience推出Visics,一个跨平台具身AI模型,能泛化到不同机器人、物体和任务。该模型基于端到端架构,在模拟和真实环境中均表现优越。实验显示,Visics在多种操作任务上成功率超过85%,远超现有基线方法。

推荐理由:RoboScience出了个Visics模型,能跨不同机器人干活,不用每换一种就重新训练,有点意思。
10:59
10:59官方账号arXiv cs.AI@Shuyi Zhang, Yunfan Lou, Hongyang Cheng, Yichen Guo, Chuyao Fu, Yaoxu Lyu, Xiaojie Zhang, Haoran Li, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang
FORCE是一个三阶段框架,通过价值校准热身和自蒸馏来稳定VLA模型的强化学习微调。它解决了Q函数不稳定导致的初期遗忘和低质量探索数据导致的策略更新低效问题。在模拟和真实任务上,FORCE取得了79%的绝对成功率提升,比此前RL方法高出10%,同时训练速度加快32.5%。该框架无需人工干预即可实现稳健性能。
推荐理由:新框架FORCE让机器人学动作更快更稳,成功率飙升79%,比现有RL方法还快32.5%,不用人插手。