论文Agent 与开发者20:45研究用强化学习视角解释 On-policy Distillation 崩溃成因把 OPD 训练崩溃讲透了,还给了屏蔽坏响应和 SFT 初始化两个可上手的缓解办法,做蒸馏的人快看。#On-policy Distillation#reward hacking#SFT#强化学习aarXiv cs.AI@Han Cui 等 6 人原文稍后读已读值得跟进有用关注 On-policy Distillation