AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

DiffusionNFT

共 2 条相关 AI 资讯
8月17日
10:17
10:17官方账号arXiv cs.LG@Yixian Xu, Yuanrui Zhang, Shengjie Luo, Liwei Wang, Di He
精选
现有扩散模型强化学习算法分为反向轨迹与前向匹配两类,分别依赖离散化似然比和带奖励标签的噪声版本。本文从正则化扩散RL目标出发,用重要性采样得到轨迹空间的策略梯度估计,其中含Flow-GRPO式Itô积分。作者推导出等价的方差缩减值梯度形式,恢复AWM和DiffusionNFT的前向匹配结构,把两类方法的差异归因于方差缩减而非RL原则。在SD3.5-M和Qwen-Image模型上的实验验证了这一解释,并取得优于既有扩散RL基线的结果。
论文Flow-GRPOAWMDiffusionNFT

推荐理由:这篇论文把Flow-GRPO、AWM、DiffusionNFT几套方法统一到一个框架里,说清了它们差别只是方差缩减,还在SD3.5-M和Qwen-Image上跑赢了之前的方案。
原文
7月17日
11:58
11:58官方账号arXiv cs.LG@Yushi Huang, Xiangxin Zhou, Jun Zhang, Liefeng Bo, Tianyu Pang
MeanFlowNFT是一种新方法,将前向过程强化学习(RL)框架DiffusionNFT扩展到平均速度生成器(MeanFlow)。它利用MeanFlow身份构建瞬时速度预测器,在保持平均速度采样(实现快速少步生成)的同时进行奖励优化。实验在图像和视频生成上证明,MeanFlowNFT在SD3.5-M的8项指标中提升6项,优于先前最先进的少步RL生成器。在Wan 2.1视频模型上,4步MeanFlowNFT达到VBench 84.33分,超过50步LongCat-Video RL的82.57分。
AI模型MeanFlowNFTDiffusionNFT强化学习

推荐理由:MeanFlowNFT让平均速度生成器也能用上强化学习,4步生成效果比50步的RL模型还好,值得试。
原文
精选全部日报登录