论文10:54基于知识和梯度的强化学习用于参数化动作马尔可夫决策过程这篇论文的KGRL算法把领域知识直接融入强化学习训练,比传统基线更省样本、回报更高,适合做PAMDP相关研究的人参考。#KGRL#PAMDP#强化学习#知识引导aarXiv cs.AI@Jonas Ehrhardt 等 3 人原文稍后读已读值得跟进有用关注 KGRL