论文11:50主动离线到在线强化学习这篇论文解决了离线到在线RL中一个关键难题:在有限交互次数下,如何主动挑选微调策略而不是盲目均分预算。实验结果挺实在,值得做RL方向的朋友看看。#离线强化学习#在线强化学习#主动策略选择#上置信界aarXiv cs.LG@Alper Kamil Bozkurt 等 3 人原文稍后读已读值得跟进有用关注 离线强化学习
论文12:27HABC:分层优势加权在线RL微调VLA策略HABC方法解决了VLA在线RL微调中稀疏结果的问题,在双手机器人任务上成功率从12-44%提升到38-92%。#HABC#VLA#机器人学习#在线强化学习aarXiv cs.LG@Tongyan Fang 等 9 人原文稍后读已读值得跟进有用关注 HABC