09:54官方账号arXiv cs.LG@Varun Giridhar, Anant Khandelwal, Jeremy A. Collins, Ignat Georgiev, Animesh Garg行为克隆(BC)在机器人操作方面取得了显著进展,但其无法自我改进的局限性限制了其发展。本文提出Q-规划,通过将小型离线策略Q函数与大型视觉运动BC策略相结合,实现了价值引导的动作选择和在线自我改进。在LIBERO和双臂RoboTwin上,10次自我改进将所有基准分数提升(LIBERO-10从93%到99%,RoboTwin从83.8%到91.4%),并缩短了接近上限的套件(LIBERO-Object,LIBERO-Goal)的成功场景。在两个接触丰富的双臂真实机器人任务中,相同的循环(BC冻结,无人工干预)仅通过其自身的部署回放就纯粹提升了40%到90%(堆叠杯子)和25%到80%(插入钱包),而仅对成功回放进行SFT则停滞在55%和30%。在相同的在线预算下,Q-规划是唯一一种在Best-of-N、过滤SFT、IBRL、DSRL和DAWR中稳定地从失败中改进而不需要训练辅助演员的方法。论文Q-Planning机器人策略自我改进推荐理由:这项研究提出了Q-规划,通过离线策略Q函数与大型视觉运动BC策略的结合,实现了机器人策略的自我改进,显著提升了机器人操作的性能,值得一试。原文稍后读已读值得跟进有用关注 Q-Planning
09:34官方账号arXiv cs.LG@William Bolton, Philip Torr这项研究将肿瘤药物开发建模为离线决策问题,预测决策日后六个月的试验组合。研究者整合31.7k条公共记录,构成881个离线决策片段,覆盖45个历史项目。对比四种离线目标和四个前沿LLM智能体后,奖励加权行为克隆表现最佳,指示F1达46.2%,严格F1为14.2%;表现最好的工具智能体分别只有25.0%和2.1%。在2025年8月后的数据上,离线训练模型也明显超过未微调基线。论文临床试验离线决策行为克隆推荐理由:用真实试验数据训练AI规划临床试验,奖励加权行为克隆F1达46.2%,比工具智能体高很多,做医药AI的可以看。原文稍后读已读值得跟进有用关注 临床试验
11:29官方账号arXiv cs.AI@Steven Oh, Jason Jingzhou Liu, Tony Tao, Philip Han, Kenneth Shaw, Satoshi Funabashi, Ruslan Salakhutdinov, Deepak Pathak精选本文提出NEXT方法,通过数据驱动的方式仅用10分钟自由运动数据训练1分钟,即可估计机械臂外部关节力矩,无需专用力传感器。结合FIRST重采样训练策略,在行为克隆中提升接触任务表现,五个长时任务中任务进度提升超17%。该方法让低成本机械臂也能实现力反馈遥操作和策略学习,无需额外硬件。代码和视频已开源。论文力感知机器人操作行为克隆推荐理由:做机器人操作研究的团队终于有了低成本力感知方案——NEXT仅需10分钟数据就能替代昂贵传感器,FIRST让行为克隆在接触任务中提升17%进度,建议做遥操作或灵巧操作的开发者直接试。原文稍后读已读值得跟进有用关注 力感知
12:33官方账号arXiv cs.LG@Quinn Pfeifer, Ethan Pronovost, Paarth Shah, Khimya Khetarpal, Siddhartha Srinivasa, Abhishek Gupta精选华盛顿大学团队提出 DARP(差异感知检索策略),一种半参数检索式模仿学习方法,通过重用在推理时的训练数据来缓解行为克隆的分布外泛化问题。DARP 不学习全局策略,而是基于专家演示的 k 近邻、对应动作及邻居与查询状态的相对距离向量来预测动作。该方法无需额外数据收集、在线专家反馈或任务特定知识,在连续控制和机器人操作等任务上比标准行为克隆提升 15-46%。代码和演示已开源。论文模仿学习行为克隆检索增强推荐理由:DARP 用检索替代全局映射,解决了行为克隆在部署时误差累积的痛点,做机器人学习和模仿学习的开发者可以直接参考其开源代码。原文稍后读已读值得跟进有用关注 模仿学习
13:37rohanpaul_ai@rohanpaul_ai76°Meta 在 4 月 30 日的全员大会上泄露音频显示,公司正利用自家工程师的工作痕迹(包括代码编辑、测试、修复、工具选择等步骤)来训练编程 AI。扎克伯格认为,让模型观察“真正聪明的人”完成任务,比使用外包编写的示例数据更有效。这种“行为克隆”方法不仅教 AI 什么是正确代码,还教它如何从模糊任务逐步推导出解决方案。与此同时,Meta 计划裁员约 8000 人(占员工 10%),并将约 7000 人转向 AI 相关工作。这意味着人类专家的经验正在被转化为训练数据,然后被 AI 压缩吸收。行业Meta编程助手行为克隆推荐理由:Meta 把自家工程师的思考过程变成训练数据,做 AI 编程或关注 AI 对就业影响的开发者值得细看——这可能是未来 AI 训练范式的转折点。原文稍后读已读值得跟进有用关注 Meta