研究证明 Success Conditioning 在一类 MDP 上收敛于最优策略
如果你做强化学习,这篇把平时凭感觉用的 success conditioning 给了收敛证明和速率,折扣 MDP 和单期 MDP 分别给了 O 界,理论党可以细看。
如果你做强化学习,这篇把平时凭感觉用的 success conditioning 给了收敛证明和速率,折扣 MDP 和单期 MDP 分别给了 O 界,理论党可以细看。
想搞懂马尔可夫决策过程控制器可解释性的可以看看这个。dtControl2+ε用ε容忍度换更小更易懂的决策树,比原先的压缩效果好很多。