11:47官方账号arXiv cs.LG@Rohit Kumar Salla, Manoj Saravanan, Simon Stepputtis扩散策略在连续控制中性能出色,但迭代去噪带来高计算成本。POGP框架通过Bellman式递归学习每个中间去噪步骤的前缀值函数。POGP的前缀值函数提供辅助训练目标,并在测试时决定是否提前停止。在MuJoCo的4个环境中与12个基线对比,POGP将所需去噪迭代减少约2.7倍,同时保留近全部任务性能。相比最先进的动态扩散基线,前缀训练还使最终任务性能提升约3.5%。AI模型POGPDiffusion PolicyMuJoCo推荐理由:POGP能在保持性能的同时把去噪步数砍掉近三分之二,还比现有动态扩散方法更准,做连续控制的可以看看。原文稍后读已读值得跟进有用关注 POGP
10:11官方账号arXiv cs.AI@Haoran Hao, Shahram Najam Syed, Jeffrey Ichnowski, Jeff SchneiderFAR(Failure-Aware Retry)是一种让机器人在真实环境中从失败中学习的框架。它通过失败对比偏好适应(Failure-Contrastive Preference Adaptation)从失败数据中构造偏好学习,引导策略避开先前失败行为。在重试期间加入轻量动作扰动促进局部探索。在仿真和真实操作任务中,FAR相比标准Diffusion Policy平均成功率提升17.6%(仿真)和11.7%(真实)。在持续策略改进中,FAR通过利用信息性失败案例显著提升数据效率。论文FARFailure-Aware RetryDiffusion Policy推荐理由:机器人老是失败?试试FAR,它让机器人从失败自学习,不用人管。仿真和真实环境都提升10%以上。原文稍后读已读值得跟进有用关注 FAR