10:17官方账号arXiv cs.LG@Yixian Xu, Yuanrui Zhang, Shengjie Luo, Liwei Wang, Di He精选现有扩散模型强化学习算法分为反向轨迹与前向匹配两类,分别依赖离散化似然比和带奖励标签的噪声版本。本文从正则化扩散RL目标出发,用重要性采样得到轨迹空间的策略梯度估计,其中含Flow-GRPO式Itô积分。作者推导出等价的方差缩减值梯度形式,恢复AWM和DiffusionNFT的前向匹配结构,把两类方法的差异归因于方差缩减而非RL原则。在SD3.5-M和Qwen-Image模型上的实验验证了这一解释,并取得优于既有扩散RL基线的结果。论文Flow-GRPOAWMDiffusionNFT推荐理由:这篇论文把Flow-GRPO、AWM、DiffusionNFT几套方法统一到一个框架里,说清了它们差别只是方差缩减,还在SD3.5-M和Qwen-Image上跑赢了之前的方案。原文稍后读已读值得跟进有用关注 Flow-GRPO