AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

Diffusion Policy

共 2 条相关 AI 资讯
8月6日
11:47
11:47官方账号arXiv cs.LG@Rohit Kumar Salla, Manoj Saravanan, Simon Stepputtis
扩散策略在连续控制中性能出色,但迭代去噪带来高计算成本。POGP框架通过Bellman式递归学习每个中间去噪步骤的前缀值函数。POGP的前缀值函数提供辅助训练目标,并在测试时决定是否提前停止。在MuJoCo的4个环境中与12个基线对比,POGP将所需去噪迭代减少约2.7倍,同时保留近全部任务性能。相比最先进的动态扩散基线,前缀训练还使最终任务性能提升约3.5%。
AI模型POGPDiffusion PolicyMuJoCo

推荐理由:POGP能在保持性能的同时把去噪步数砍掉近三分之二,还比现有动态扩散方法更准,做连续控制的可以看看。
原文
7月2日
10:11
10:11官方账号arXiv cs.AI@Haoran Hao, Shahram Najam Syed, Jeffrey Ichnowski, Jeff Schneider
FAR(Failure-Aware Retry)是一种让机器人在真实环境中从失败中学习的框架。它通过失败对比偏好适应(Failure-Contrastive Preference Adaptation)从失败数据中构造偏好学习,引导策略避开先前失败行为。在重试期间加入轻量动作扰动促进局部探索。在仿真和真实操作任务中,FAR相比标准Diffusion Policy平均成功率提升17.6%(仿真)和11.7%(真实)。在持续策略改进中,FAR通过利用信息性失败案例显著提升数据效率。
论文FARFailure-Aware RetryDiffusion Policy

推荐理由:机器人老是失败?试试FAR,它让机器人从失败自学习,不用人管。仿真和真实环境都提升10%以上。
原文
精选全部日报登录