09:58官方账号arXiv cs.LG@Chen Wang, Zhaochun Li, Jionghao Bai, Yining Zhang, Hexuan Deng, Ge Lan, Yue WangDistilled RL将教师模型监督集成到强化学习目标中,提供细粒度指导并选择性传递新知识。它包含三个组件:逆重要性采样与剪切、负样本重置、序列级几何归一化。实验表明,在家族内和跨家族蒸馏场景下,Distilled RL在pass@1和pass@k上均显著优于标准RL和基于策略的蒸馏OPD。该方法能有效传递教师模型先前不可用的知识,代码已开源。AI模型Distilled RLLLM后训练推荐理由:这个新方法把强化学习和知识蒸馏结合在一起,解决了RL和OPD各自的短板,跨家族蒸馏效果尤其好。原文稍后读已读值得跟进有用关注 Distilled RL