论文Agent 与开发者19:09IDRF:掩码离散扩散模型的逆蒸馏奖励微调框架一篇扩散模型微调的论文,教你怎么给少步掩码扩散模型做奖励微调,还能少 32 倍去噪步数,做生成方向的可以看看。#IDRF#扩散模型#奖励微调#策略梯度aarXiv cs.LG@Vladislav Gromadskii 等 7 人原文稍后读已读值得跟进有用关注 IDRF