Estimate, Don't Imitate:复用可微状态策略做视觉运动控制
训练机械臂策略的新思路:不蒸馏专家,只学视觉补状态,真机 Panda 上 76% 成功率,做 sim-to-real 的朋友可以看看。
训练机械臂策略的新思路:不蒸馏专家,只学视觉补状态,真机 Panda 上 76% 成功率,做 sim-to-real 的朋友可以看看。
朋友,这是篇挺有意思的论文,讲的是怎么用一种叫RetireOPD的新方法来训练AI智能体,效果比直接用强化学习好不少,在几个任务上都有明显提升。
SafeSteer 用极低成本(100 个样本)解决了安全对齐损害通用能力的痛点,做 LLM 安全或对齐的团队可以直接参考其局部化蒸馏方法,大幅减少数据依赖。