11:47官方账号arXiv cs.LG@Rohit Kumar Salla, Manoj Saravanan, Simon Stepputtis扩散策略在连续控制中性能出色,但迭代去噪带来高计算成本。POGP框架通过Bellman式递归学习每个中间去噪步骤的前缀值函数。POGP的前缀值函数提供辅助训练目标,并在测试时决定是否提前停止。在MuJoCo的4个环境中与12个基线对比,POGP将所需去噪迭代减少约2.7倍,同时保留近全部任务性能。相比最先进的动态扩散基线,前缀训练还使最终任务性能提升约3.5%。AI模型POGPDiffusion PolicyMuJoCo推荐理由:POGP能在保持性能的同时把去噪步数砍掉近三分之二,还比现有动态扩散方法更准,做连续控制的可以看看。原文稍后读已读值得跟进有用关注 POGP