12:01官方账号arXiv cs.AI@Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu, Weiming Lu, Yongliang Shen提出Relay-OPD方法,解决同策略蒸馏(OPD)中的前缀失败问题:当学生模型进入错误推理方向后,后续生成偏离正确路径。该方法利用教师-学生在失败前缀上的延续不对称性作为无标签触发信号,让教师短暂接管生成然后交回学生训练。使用Qwen3-4B-Instruct-2507作为教师,Qwen3-0.6B/1.7B-Non-Thinking作为学生,在8个数学推理基准上,Relay-OPD在全部基准中取得最佳或次佳结果,1.7B模型平均超越标准OPD 5.73%,超越最强基线FastOPD 1.49%,且训练轨迹长度减少超过50%。论文Relay-OPDQwen3知识蒸馏推荐理由:这篇论文提出了一个很聪明的改进:当学生模型推理跑偏时,让老师模型短暂接管一段,再交回学生继续训练。在Qwen3小模型上效果明显,数学推理准确率提升,训练还更快。原文稍后读已读值得跟进有用关注 Relay-OPD