论文10:21
TGDT:用预测误差筛选可信上下文,改进 Decision Transformer 长序列表现一篇改进 Decision Transformer 的新论文:发现长序列跑崩时预测误差会飙升,先筛掉不可信上下文再选动作,D4RL 上验证有效,做离线强化学习的可以看看。
一篇改进 Decision Transformer 的新论文:发现长序列跑崩时预测误差会飙升,先筛掉不可信上下文再选动作,D4RL 上验证有效,做离线强化学习的可以看看。
做强化学习研究的团队终于有了一个能同时解决分布偏移和灾难性遗忘的通用框架——COOPO 的循环设计让离线数据复用和在线探索形成正向循环,D4RL 上效果显著,建议做 RL 算法开发的同学点开看理论证明和实验细节。