8月20日
05:25
8月7日
13:24
13:24官方账号arXiv cs.AI@ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng
论文提出DASH方法,用于改进带可验证奖励的强化学习(RLVR)中奖励稀疏的问题。标准OPSD对所有局部发散使用相同权重,忽略了生成过程中发散序列的时间结构。DASH根据局部蒸馏信号与序列均值的差距自适应调整token级监督权重,控制反向多步聚合。在三个数学推理基准和三种模型规模上,DASH均优于匹配的vanilla OPSD。该方法复用OPSD已有的师生分布,不额外增加前向传播成本。
推荐理由:这篇论文提出了DASH,能让推理模型在自蒸馏时按发散情况动态调整权重,三个数学基准上全面超过原版OPSD,还不用额外算力。
7月3日
09:19
09:19官方账号arXiv cs.LG@Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye
研究发现在线自蒸馏(OPSD)在长思维链推理模型上效果有限且破坏推理稳定性。通过分解教师监督信号,发现参考导致的成分驱动死记硬背,而可迁移的问题条件成分被忽略。提出两步解法:首先构建仅参考教师以隔离不可迁移成分,再用点互信息(PMI)过滤掉参考捷径。在4个长思维链模型和2个数据集上,该方法相比基线和标准OPSD均取得一致改进。
推荐理由:这篇论文解决了OPSD在长推理模型上越蒸馏越笨的问题,用PMI过滤器保留思考能力,值得做推理优化的朋友看看。