论文13:09一种基于基线策略的模型无关强化学习增强方法做强化学习训练的团队可以省下从头调参的功夫——用现有基线策略做跳板,训练效率更高且最终策略更强,值得在连续控制任务上试试。#强化学习#策略增强#基线策略#模型无关aarXiv cs.AI@Anton Bolychev 等 4 人原文稍后读已读值得跟进有用关注 强化学习