论文11:50物理感知策略蒸馏实现可解释强化学习研究者用决策树“拆解”了黑箱TD3,在倒立摆任务上性能不减,还解析了控制规律,适合安全关键AI参考。#TD3#可解释性#决策树#策略蒸馏aarXiv cs.LG@Shaker Al-Tamari, Waled Kadour原文稍后读已读值得跟进有用关注 TD3
论文11:22Lyapunov指数作为物理信息密集奖励:RL发现超越Kapitza摆的稳定化这篇论文用Lyapunov指数做奖励,让强化学习不仅复现了Kapitza摆,还找到了更稳的竖直不倒方案,挺有意思。#Lyapunov exponent#Kapitza pendulum#强化学习#倒立摆aarXiv cs.LG@Slava Andrejev原文稍后读已读值得跟进有用关注 Lyapunov exponent