论文11:50主动离线到在线强化学习这篇论文解决了离线到在线RL中一个关键难题:在有限交互次数下,如何主动挑选微调策略而不是盲目均分预算。实验结果挺实在,值得做RL方向的朋友看看。#离线强化学习#在线强化学习#主动策略选择#上置信界aarXiv cs.LG@Alper Kamil Bozkurt 等 3 人原文稍后读已读值得跟进有用关注 离线强化学习