Defensive Policy Gradient:去掉重要性权重方差假设的 O(ε⁻³) 采样复杂度
优化策略梯度的人可以看看:新算法 Defensive Policy Gradient 不再依赖重要性权重方差假设,就能拿到 O(ε⁻³) 采样复杂度,还配了下界证明。
优化策略梯度的人可以看看:新算法 Defensive Policy Gradient 不再依赖重要性权重方差假设,就能拿到 O(ε⁻³) 采样复杂度,还配了下界证明。
有人把交叉熵重新解读成策略梯度,然后推出一行代码就能替换的 horizon loss,在 ResNet-50 和 ViT-S/16 上实测涨点,做分类训练的可以试试。
这篇论文把PPO用到了GFlowNet上,收敛更快、数据效率更高,做离散采样研究的可以看看。
做RL研究或语言模型微调的团队,如果正为多样性-性能权衡头疼,这篇论文给出了一个理论干净的新框架——把奖励不确定性当作多样性来源,不用额外调参。值得细读。
这篇论文为多智能体强化学习中的均衡选择问题提供了理论解释和实用机制,做多智能体系统或博弈论应用的开发者值得关注,尤其是对合作均衡有需求的团队可以看看如何通过对手感知修正引导策略收敛。
本文从理论层面揭示了策略梯度方法短视性的根源,并提出了具有指数级收敛保证的改进方案。对强化学习从业者而言,这是一项重要的理论突破,有望推动受限策略类在复杂多智能体等场景的实际应用。