FAITH:面向高维系统的可行性感知安全强化学习框架
arXiv 上这篇论文做安全强化学习,29 自由度人形机器人跑到 99.95% 安全率还保留 97% 回报,真机 Unitree G1 也验证了,做机器人方向可以看看。
arXiv 上这篇论文做安全强化学习,29 自由度人形机器人跑到 99.95% 安全率还保留 97% 回报,真机 Unitree G1 也验证了,做机器人方向可以看看。
这篇论文解决了AI安全领域一个关键问题:如何区分策略本身的安全能力与外部过滤器的保护。做安全强化学习或控制系统的研究者值得关注,其安全归因协议可直接用于评估其他策略的真实安全性。