11:42官方一手arXiv: Google DeepMind@Hoda Yamani, Henry Williams, Bruce A. MacDonald本文提出NSPER方法,在图像强化学习中整合新颖性和惊喜信号来优化经验回放。NSPER+R进一步将这些信号作为内在奖励,共同提升回放质量和探索效果。实验在DeepMind Control Suite任务上显示,NSPER和NSPER+R比现有方法提高了训练效率和收敛速度。论文Reinforcement LearningNSPER图像强化学习推荐理由:DeepMind团队提出NSPER方法,结合新颖性和惊喜信号,让强化学习更高效探索。原文稍后读已读值得跟进有用关注 Reinforcement Learning
12:10官方账号arXiv cs.LG@Nathan Gavenski, Juarez Monteiro, Francisco Galuppo, Adriano Veloso, Odinaldo RodriguesPACT是一种混合架构,结合快速反应式RL策略与慢速SLM规划器。它异步调用2B参数SLM生成候选动作计划,经仿真验证安全、可行、完整后直接执行,无需重训练RL策略。在三个难度递增的FrozenLake配置上,PACT超越所有基线,表明规划与反应协同比单独使用更强。论文PACTSmall Language ModelReinforcement Learning推荐理由:这篇论文提出了PACT,用一个小型语言模型来规划动作,再结合强化学习策略,在FrozenLake上比纯RL效果好,而且不用重训练。原文稍后读已读值得跟进有用关注 PACT