11:35官方账号arXiv cs.LG@Perry Dong, Ron Polonsky, Dorsa Sadigh, Chelsea Fin论文研究了在线RL微调时预训练Q函数的效果。发现预训练Q函数相比随机初始化提升有限,因为预训练的Q函数目标与在线微调收敛的Q函数存在根本性不匹配。作者提出策略集成初始化(IPE)方法,通过训练多个多样策略并用其滚动数据引导Q函数学习。在连续控制基准上,IPE相比朴素Q函数预训练平均提升1.26倍微调性能。论文Q函数强化学习预训练推荐理由:如果你做强化学习微调,这篇论文告诉你预训练Q函数可能没用,还给了更高效的IPE方法,实测效果更好。原文稍后读已读值得跟进有用关注 Q函数