11:42官方一手arXiv: Google DeepMind@Hoda Yamani, Yuning Xing, Koen van Rijnsoever, Bruce A. MacDonald, Henry Williams研究人员提出即时回合重复(IER)机制,通过立即重复成功回合中的动作序列来提升强化学习样本效率。该机制被集成到SAC和TD3算法中,并在MuJoCo和DeepMind Control Suite等基准测试上进行了验证。实验结果表明,这种简单方法优于标准基线和自我模仿学习基线,在机器人操作任务中也表现出色。AI模型强化学习IERSAC推荐理由:这篇论文提出了一种简单却有效的IER机制,能让强化学习智能体通过重复成功动作更快学习。原文稍后读已读值得跟进有用关注 强化学习
11:29官方账号arXiv cs.LG@Ya-Chia Shen, Woei-Leong Chan论文提出一种物理感知的端到端深度强化学习(DRL)方法,直接对四旋翼的低层体轴输入(总推力与体轴扭矩)进行控制,结合高保真Simulink环境与12状态刚体模型。方法包含基于Moore-Penrose伪逆的Action2RPM分配,以及一阶作动器动力学(时间常数0.076s)和转子陀螺耦合。在四种DRL算法(DDPG、TD3、PPO、SAC)的两阶段任务中,SAC和TD3展现出更优的稳定性和探索效率,PPO样本效率较低。研究强调了建模作动器滞后与气动力矩对稳定低层控制的重要性,并提供了可复现的基准。论文四旋翼控制深度强化学习物理感知推荐理由:这篇论文把物理建模和DRL结合起来控无人机,SAC和TD3比PPO表现好,有具体数字和对比,搞控制或强化学习的可以看看。原文稍后读已读值得跟进有用关注 四旋翼控制
11:50官方账号arXiv cs.LG@Shaker Al-Tamari, Waled Kadour在倒立摆基准上,TD3教师模型(Twin Delayed DDPG)的策略被蒸馏至浅层决策树学生。通过自定义物理感知特征和噪声Oracle Rollouts生成数据集,学生模型性能与教师相当。控制理论分析显示从连续控制转向离散规则控制导致高频Bang-Bang执行和稳定双模态极限环。BIBO稳定性得到维持,同时提供了全局和局部可解释性。论文TD3可解释性决策树推荐理由:研究者用决策树“拆解”了黑箱TD3,在倒立摆任务上性能不减,还解析了控制规律,适合安全关键AI参考。原文稍后读已读值得跟进有用关注 TD3
10:16官方账号arXiv cs.LG@Mohammadreza Kasaei, Klemen Voncina, Hamidreza Kasaei该论文研究机器人在多障碍物环境中安全投掷物体到目标篮筐的问题。现有方法如TossingBot假设无障碍环境,而本工作引入势场状态表示(PFR),以固定网格编码篮筐吸引和障碍排斥,使强化学习策略能泛化到任意障碍数量与配置。在仿真中使用SAC、DDPG、TD3三种算法训练,其中SAC表现最稳定。真实实验中,对未见过的可投掷物体取得了高达90%的成功率,验证了PFR的鲁棒性和实用性。论文SACDDPGTD3推荐理由:这篇论文教机器人怎么在乱堆东西的桌面上把物体扔进篮筐,用势场表示结合SAC算法,真实实验成功率90%,比TossingBot强不少。原文稍后读已读值得跟进有用关注 SAC