13:24官方账号arXiv cs.AI@ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng论文提出DASH方法,用于改进带可验证奖励的强化学习(RLVR)中奖励稀疏的问题。标准OPSD对所有局部发散使用相同权重,忽略了生成过程中发散序列的时间结构。DASH根据局部蒸馏信号与序列均值的差距自适应调整token级监督权重,控制反向多步聚合。在三个数学推理基准和三种模型规模上,DASH均优于匹配的vanilla OPSD。该方法复用OPSD已有的师生分布,不额外增加前向传播成本。论文DASHOPSDRLVR推荐理由:这篇论文提出了DASH,能让推理模型在自蒸馏时按发散情况动态调整权重,三个数学基准上全面超过原版OPSD,还不用额外算力。原文稍后读已读值得跟进有用关注 DASH