论文精选11:28QGF:测试时策略优化,用价值梯度引导流模型生成高回报动作做机器人控制或连续控制RL的团队,如果受困于扩散/流模型训练的不稳定性,QGF提供了一种“训练照旧、测试优化”的实用方案,值得一试。#强化学习#流模型#测试时优化#QGFaarXiv cs.AI@Zhiyuan Zhou 等 7 人原文稍后读已读值得跟进有用关注 强化学习
论文精选11:07Safe-RULE:离线安全强化学习的数据毒化防御新框架做安全强化学习或机器人系统的团队,终于有了一个不用重训模型就能清理毒化数据的方案,值得关注。#安全强化学习#数据毒化防御#反学习#离线RLaarXiv cs.LG@Shixiong Jiang 等 3 人原文稍后读已读值得跟进有用关注 安全强化学习