9月1日
10:49
10:49官方账号arXiv cs.LG@Michal Korniak, Kamil Dybek, Benjamin Eysenbach, Marco Bagatella, Michał Bortkiewicz
精选73°
研究者将对比强化学习(CRL)从单步动作扩展到动作块,在18个离线环境和11个在线环境中分别实现了31.7%和93.1%的性能提升。研究发现,在CRL中,动作块比单步动作携带更多关于目标的信息,显著提升了评价器的表示能力。这种改进并非完全通过建模非马尔可夫、时间扩展策略或传播无偏多步回报来实现。
推荐理由:这篇论文展示了对比强化学习通过动作块建模获得显著性能提升,揭示了动作块携带更多目标信息的新机制。