论文精选10:38双流强化学习与状态感知探索这篇论文用条件流匹配把回报分布和多模态策略一起建模,解决了强化学习中的多模态探索难题,在DeepMind控制任务上吊打了扩散方法。#Dual-Flow RL#DeepMind Control Suite#Humanoid-Bench#强化学习aarXiv: Google DeepMind@Qijun Li 等 7 人原文稍后读已读值得跟进有用关注 Dual-Flow RL