10:49官方账号arXiv cs.LG@Michal Korniak, Kamil Dybek, Benjamin Eysenbach, Marco Bagatella, Michał Bortkiewicz精选73°研究者将对比强化学习(CRL)从单步动作扩展到动作块,在18个离线环境和11个在线环境中分别实现了31.7%和93.1%的性能提升。研究发现,在CRL中,动作块比单步动作携带更多关于目标的信息,显著提升了评价器的表示能力。这种改进并非完全通过建模非马尔可夫、时间扩展策略或传播无偏多步回报来实现。论文对比强化学习动作块表示学习推荐理由:这篇论文展示了对比强化学习通过动作块建模获得显著性能提升,揭示了动作块携带更多目标信息的新机制。原文稍后读已读值得跟进有用关注 对比强化学习