12:57官方一手arXiv: Google DeepMind@Xinwei Liu, Junyuan Liang, Jianting Zhang, Wuhui Chen本文提出OG-SPR,一种用于视觉连续控制的模型无关强化学习算法,融合多步潜在自预测与下一观察预测两个辅助目标。在DeepMind Control Suite的28个视觉控制任务上,OG-SPR相比现有自预测和观察预测方法获得更高的总体性能,尤其在dog和humanoid等困难任务上提升显著。该方法为共享表征引入两个轻量适配器来执行潜在自预测,避免直接强制表征满足预测目标带来的过约束问题。论文OG-SPR强化学习视觉控制推荐理由:OG-SPR把两种预测目标结合起来,28个控制任务上超过现有方法,难任务提升明显。搞视觉RL的可以看看。原文稍后读已读值得跟进有用关注 OG-SPR
10:10官方一手arXiv: Google DeepMind@Jinwen Wang, Youfang Lin, Xiaobo Hu, Qian Xu, Shuo Wang, Zhuo Chen, Kai LvT2RD提出通过自监督方式将观测分解为任务相关和任务无关表示,包含三个组件:任务相关表示一致性、交叉重建和交叉动态预测。前两个组件实现内容与风格特征解耦,第三个组件引入动态预测以进一步提取任务相关特征。在DeepMind Control Suite和Robotic Manipulation任务上,T2RD实现了SOTA的泛化性能和样本效率。论文T2RD视觉强化学习泛化推荐理由:这篇论文教你用自监督方法解耦视觉特征,T2RD在泛化能力上比现有方法强出一截,做机器人和控制任务的值得看看。原文稍后读已读值得跟进有用关注 T2RD
10:38官方一手arXiv: Google DeepMind@Qijun Li, Zheng Fu, Qi Song, Yifei He, Weitao Zhou, Kun Jiang, Diange Yang精选Dual-Flow RL利用条件流匹配(CFM)同时建模回报分布和多模态策略分布,克服了传统单峰高斯价值估计的偏差问题。该方法引入熵-协方差探索调节器(ECER),实现基于状态的自适应探索。在DeepMind Control Suite的36个任务中,Dual-Flow RL在32个任务上取得最优,并在Humanoid-Bench上显著优于diffusion-based和flow-based方法。ECER通过策略熵与动作不确定性协方差动态调节探索强度,避免了模式坍塌。论文Dual-Flow RLDeepMind Control SuiteHumanoid-Bench推荐理由:这篇论文用条件流匹配把回报分布和多模态策略一起建模,解决了强化学习中的多模态探索难题,在DeepMind控制任务上吊打了扩散方法。原文稍后读已读值得跟进有用关注 Dual-Flow RL