论文19:11MRP方法提升混合策略在强化学习中的实用性该论文提出了MRP估计器,解决了混合策略在强化学习中的方差问题,实验验证了其有效性,对从事连续控制任务的研究者和工程师具有参考价值。#强化学习#混合策略#连续控制#重新参数化aarXiv: Google DeepMind@Jiamin He 等 5 人原文稍后读已读值得跟进有用关注 强化学习