11:25官方账号arXiv cs.LG@Jai Malegaonkar, Rohan Patil, Henrik I. Christensen该研究通过受控实验,将探索奖励与多种神经记忆架构交叉,在三个环境(记忆内容的获取方式不同)中测量其相互作用。结果显示,相同的奖励信号会带来三种截然不同的交互模式:放大架构差异、将所有架构拉平到同一水平、或完全无效。研究者进一步用观测锚定奖励机形式化了奖励稀疏性,区分结构稀疏性与潜在稀疏性,证明探索与记忆是互补而非替代关系。论文强化学习探索奖励记忆架构推荐理由:这份论文把探索奖励和记忆架构放一起测,发现奖励结构不同,效果天差地别,做RL的值得看看。原文稍后读已读值得跟进有用关注 强化学习