10:55官方账号arXiv cs.LG@Zhaoyu Zhu, Rui Gao, Shuang LiWasserstein策略梯度(WPG)通过动作空间的传输更新状态条件策略。研究熵正则化折扣线性二次(LQ)控制问题时,Bellman验证论证表明该问题存在线性高斯最优策略。WPG可精确化为关于反馈增益和动作协方差的有限维常微分方程(ODE)。该ODE从任意可行初始值全局适定且指数收敛,且收敛指数在熵温度趋于0时保持正极限,不含exp(-c/τ)扰动因子。论文Wasserstein策略梯度线性二次控制熵正则化推荐理由:这篇论文把WPG在LQ问题上化简成ODE,证明了指数收敛,做控制理论的可以看看。原文稍后读已读值得跟进有用关注 Wasserstein策略梯度