10:40官方账号arXiv cs.LG@Taha Shieenavaz, Shabnam Zareshahraki, Loris Nanni并行化Q网络(PQN)在无经验回放和目标网络条件下实现稳定离策略学习。研究者在严格参数约束下评估了8种CNN拓扑,并集成Hadamax编码及分布式、集成、决斗等Q学习扩展。在Atari-57基准上,Aftab的IQM人类归一化得分为6.479,对标准PQN基线的改进概率为0.86。在Procgen Hard基准上,Aftab的IQM归一化得分为0.418,高于基线的0.382。完整框架已开源在GitHub。论文AftabPQNCNN推荐理由:Aftab架构在Atari-57上拿到IQM 6.479,比标准PQN基线强不少,代码和训练配置都开源了,搞RL的可以看看。原文稍后读已读值得跟进有用关注 Aftab