8月26日
11:28
11:28官方账号arXiv cs.AI@Kai Ruan, Jinghao Lin, Qianshan Wei, Ziqi Zhou, Zihe Huang
SPO++通过流对齐策略优化解决了Group-relative reinforcement learning的依赖问题,提高了在线学习效率。在ALFWorld和Math-TIR上的实验表明,SPO++在两个模型规模上均优于SPO。
推荐理由:SPO++在异步智能体强化学习领域取得了显著进展,提高了在线学习效率,值得一试。