论文12:08On-Policy Delta Distillation:一种新的推理能力蒸馏方法这篇论文用老师模型和基础模型的差值做蒸馏信号,比直接模仿老师更强,数学代码推理都更好,训练时间还短。#OPD²#蒸馏#推理模型#强化学习aarXiv cs.LG@Byeongho Heo 等 4 人原文稍后读已读值得跟进有用关注 OPD²