11:50官方账号arXiv cs.LG@Alper Kamil Bozkurt, Shangtong Zhang, Yuichi Motai该论文聚焦离线到在线强化学习(O2O-RL)中有限交互预算下的策略选择问题。提出一种主动策略选择方法,通过上置信界(UCB)平衡策略评估与微调的交互分配。UCB基于局部线性性能预测,在在线评估中拟合观测数据。实验表明该方法在多个基准任务上优于现有O2O-RL基线。这是首个系统研究该问题的学术工作。论文离线强化学习在线强化学习主动策略选择推荐理由:这篇论文解决了离线到在线RL中一个关键难题:在有限交互次数下,如何主动挑选微调策略而不是盲目均分预算。实验结果挺实在,值得做RL方向的朋友看看。原文稍后读已读值得跟进有用关注 离线强化学习
12:27官方账号arXiv cs.LG@Tongyan Fang, Siyuan Huang, Naiyu Fang, Ganlong Zhao, Zhongjin Luo, Jianbo Liu, Xiaogang Wang, Ying Dong, Hongsheng Li针对VLA策略在线RL微调中每个回合仅产生二元结果(成功/失败)的问题,现有方法将稀疏结果简化为单一标量优势,混淆了可行性与效率两类目标。本文提出分层优势加权行为克隆(HABC),训练两个独立critic头分别优化这两类目标,并通过状态自适应门(gt)合并其输出。在三个接触丰富的双手机器人任务上,HABC将监督微调(SFT)基线36%、44%、12%的成功率分别提升至92%、88%、38%。论文HABCVLA机器人学习推荐理由:HABC方法解决了VLA在线RL微调中稀疏结果的问题,在双手机器人任务上成功率从12-44%提升到38-92%。原文稍后读已读值得跟进有用关注 HABC