6月9日
13:09
13:09官方账号arXiv cs.AI@Anton Bolychev, Georgiy Malaniya, Sinan Ibrahim, Pavel Osinenko
该论文提出了一种新的强化学习训练方法,通过嵌入已有的基线策略来提升训练效率。方法在训练初期依赖基线策略,逐步将控制权转移给可训练的学习策略,最终使学习策略独立运行。理论分析证明了该方法在目标到达概率上的优势,实验表明其在连续控制任务中表现优于或持平于现有方法,且全程保持高目标到达率。
推荐理由:做强化学习训练的团队可以省下从头调参的功夫——用现有基线策略做跳板,训练效率更高且最终策略更强,值得在连续控制任务上试试。
5月20日
11:41
11:41官方一手arXiv: Google DeepMind@Bosun Liang, Shuo Pei, Zirui Chen, Chuanzhi Fan, Chen Sun, Yuankai Wu, Huachun Tan, Yong Wang
精选
强化学习常产生高频振荡控制信号,影响物理部署的安全与稳定。显式动作分块虽能预测固定轨迹,但会扩大策略输出维度,导致优化困难。本文提出双窗口平滑(DWS)框架,通过隐式动作分块实现平滑连续控制,无需扩展动作空间。DWS包含执行窗口(确保物理平滑)和价值窗口(修正评论家偏差),并引入轻量级时序正则化器。在DeepMind控制套件、工业能源管理及视觉自动驾驶任务中,DWS超越现有方法,实现100%成功率。
推荐理由:做机器人控制或自动驾驶的团队,DWS解决了强化学习控制信号抖动这个老大难问题,无需增加模型复杂度就能提升安全性和成功率,值得在你们的仿真或实机任务上试试。