论文12:01Relay-OPD:通过轨迹接力改进同策略蒸馏这篇论文提出了一个很聪明的改进:当学生模型推理跑偏时,让老师模型短暂接管一段,再交回学生继续训练。在Qwen3小模型上效果明显,数学推理准确率提升,训练还更快。#Relay-OPD#Qwen3#知识蒸馏#数学推理aarXiv cs.AI@Haolei Xu 等 8 人原文稍后读已读值得跟进有用关注 Relay-OPD