论文10:08掩码感知策略梯度提升扩散语言模型推理能力这篇论文给扩散语言模型加了个策略梯度法子,数学推理和编程测试成绩都刷了新高,搞RL训练模型的可以看看。#MDLM#扩散语言模型#策略梯度#GSM8KaarXiv cs.AI@Haran Raajesh 等 4 人原文稍后读已读值得跟进有用关注 MDLM