论文精选14:36COOPO:循环离线-在线策略优化算法,提升强化学习效率做强化学习研究的团队终于有了一个能同时解决分布偏移和灾难性遗忘的通用框架——COOPO 的循环设计让离线数据复用和在线探索形成正向循环,D4RL 上效果显著,建议做 RL 算法开发的同学点开看理论证明和实验细节。#强化学习#离线-在线混合#策略优化#D4RLaarXiv cs.AI@Qisai Liu 等 6 人原文稍后读已读值得跟进有用关注 强化学习