论文精选10:37BAPR:贝叶斯遗忘分段鲁棒强化学习应对非平稳连续控制做非平稳控制或鲁棒强化学习的团队终于有了一个理论扎实且可验证的方案——BAPR在稳定期和变化期之间自动平衡保守性,Lean 4形式化验证保证了可靠性,值得研究RL安全性的开发者点开。#强化学习#非平稳控制#贝叶斯变化检测#鲁棒控制aarXiv cs.LG@Yifan Zhang, Liang Zheng原文稍后读已读值得跟进有用关注 强化学习