7月17日
10:08
10:08官方账号arXiv cs.AI@Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl
论文提出掩码感知策略梯度方法,解决强化学习应用于掩码扩散语言模型(MDLM)时对数似然估计难的问题。方法将MDLM生成建模为两阶段动作MDP,策略梯度分解为token项和掩码项。联合优化两项后,模型在GSM8K上达87.1%准确率,在MBPP上达53.4%得分,均达到当前最优。
推荐理由:这篇论文给扩散语言模型加了个策略梯度法子,数学推理和编程测试成绩都刷了新高,搞RL训练模型的可以看看。
6月16日
6月3日
10:25
10:25官方账号arXiv cs.AI@Anthony GX-Chen, Ankit Anand, Gheorghe Comanici, Zaheer Abbas, Eser Aygün, David Smalling, Shibl Mourad, Doina Precup, André Barreto, Mark Rowland
经典强化学习追求确定性策略以最大化标量奖励期望,但在语言模型微调或科学发现等现代应用中,多样性至关重要。现有方法如熵正则化或多样性奖励常需脆弱权衡,牺牲性能换取随机性。本文提出将奖励函数视为分布而非标量,通过非线性的动作集目标函数,使校准的行为多样性自然涌现,且不牺牲期望奖励。在上下文赌博机设定下,推导了原则性的梯度估计器,证明该框架泛化了策略梯度与动作集方法。实验表明,该方法为需要行为广度的复杂RL任务提供了稳健的理论替代方案。
推荐理由:做RL研究或语言模型微调的团队,如果正为多样性-性能权衡头疼,这篇论文给出了一个理论干净的新框架——把奖励不确定性当作多样性来源,不用额外调参。值得细读。