论文精选12:19LP-DS:轻量级扩散策略微调方法,提升机器人操控与强化学习效率做机器人操控或强化学习的团队,终于有了一个不更新大模型也能微调扩散策略的轻量方案——LP-DS 在保持动作多样性的同时提升回报,建议试试看能否解决你的分布偏移问题。#扩散模型#强化学习#机器人操控#策略微调1 个信源在谈事件专题aarXiv: OpenAI@Hikmet Simsir, Ozgur S. Oguz2 个信源在谈原文稍后读已读值得跟进有用关注 扩散模型