11:50
11:50
官方账号arXiv cs.LG@Jingwei Song, Haofeng Xu, Jie Xiao, Chengke Bao, Jingwei Shi, Pengbin Feng, Weixun Wang, Yuhang Han, Chuan Wu, Linfeng Zhang, Bill Shi 该论文研究异步GRPO(群体相对策略优化)中陈旧rollout对策略优化的影响。作者将行为策略显式纳入GRPO替代目标,并区分学习器使用的替代梯度映射与依赖分布的总体目标的真实全导数。在局部有界性、分布平滑性和行为策略平滑性假设下,证明陈旧rollout引入的每步替代梯度偏差为O(S * eta),其中S是最大rollout滞后,eta是学习率。进一步导出条件性崩溃时间缩放定律:当周期内漂移低于批量级裁剪半径时,崩溃主要由累积学习器漂移T * eta决定;当陈旧rollout约束激活时,稳定性显式依赖于S * eta。从而得到双约束稳定性条件eta << min{R_batch/(S*G_upd), R_crit/(T*G_upd)},解释了在有限时间范围内最大稳定学习率对陈旧性依赖较弱的原因。
推荐理由:想搞异步RLHF训练的可以看这篇,把陈旧rollout对学习率的影响定量化了,推导了缩放条件,比经验调参更靠谱。
10:23
10:23
官方账号arXiv cs.AI@Zhuoxuan Zhang, Kangqi Ni, Yuhang Chen, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Frank Shyu, Adam, Song, Sandeep Pandey, Luke Simon, Tianlong Chen, Xi Liu 生成式推理重排序器(GR2)通过自回归解码生成推理链后再排序,准确率高但推理速度慢。论文提出Diffusion-GR2,将自回归重排序器转换为块扩散模型,并行解码多个位置。通过转换微调(CFT)解决结构间隙,确保输出有效排列;通过在线蒸馏(OPD)和强化学习(RL)弥补分布间隙。在Amazon Beauty数据集上,Diffusion-GR2准确率接近自回归基线,推理吞吐量提升2.4-3.5倍。消融实验显示CFT恢复大部分转换损失,在线蒸馏进一步缩小差距。
推荐理由:想加速推理重排序又不想掉精度?这篇把自回归GR2换成块扩散,速度提升2.4倍以上,准确率几乎没降,干货满满。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。