论文10:36Proximal Policy Optimization for Amortized Discrete Sampling这篇论文把PPO用到了GFlowNet上,收敛更快、数据效率更高,做离散采样研究的可以看看。#PPO#GFlowNet#离散采样#策略梯度aarXiv cs.LG@Anna Zykova-Myzina 等 4 人原文稍后读已读值得跟进有用关注 PPO