AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

熵正则化

共 2 条相关 AI 资讯
8月10日
10:55
10:55官方账号arXiv cs.LG@Zhaoyu Zhu, Rui Gao, Shuang Li
Wasserstein策略梯度(WPG)通过动作空间的传输更新状态条件策略。研究熵正则化折扣线性二次(LQ)控制问题时,Bellman验证论证表明该问题存在线性高斯最优策略。WPG可精确化为关于反馈增益和动作协方差的有限维常微分方程(ODE)。该ODE从任意可行初始值全局适定且指数收敛,且收敛指数在熵温度趋于0时保持正极限,不含exp(-c/τ)扰动因子。
论文Wasserstein策略梯度线性二次控制熵正则化

推荐理由:这篇论文把WPG在LQ问题上化简成ODE,证明了指数收敛,做控制理论的可以看看。
原文
5月26日
12:22
12:22官方账号arXiv cs.LG@Zhaoyu Zhu, Rui Gao, Shuang Li
精选
该论文首次为Wasserstein策略梯度(WPG)方法在熵正则化强化学习中的全局收敛性提供了严格理论证明。WPG利用动作分布的最优传输几何,通过软Q函数的动作梯度与Langevin扩散更新策略,但标准Langevin分析因RL目标通过Bellman递归依赖策略而失效。研究者通过Bellman残差的KL表示、Bellman收缩与Bellman预解恒等式,建立了分布Polyak-Łojasiewicz条件,并利用对数Sobolev不等式控制离散化误差,最终证明WPG以几何速率收敛至全局最优(存在离散化偏差)。该工作揭示了熵正则化RL虽非传统凸优化,但Bellman递归诱导了有利的PL几何结构。
论文强化学习Wasserstein策略梯度全局收敛

推荐理由:做连续控制RL的理论研究者会感兴趣——这篇论文用Bellman结构替代凸性假设,为WPG的全局收敛提供了首个完整证明,建议做策略梯度理论的团队仔细读。
原文
精选全部日报登录