Off-Policy Merging 持续学习方法超越 On-Policy 自蒸馏
做模型持续训练的必看:不用贵的 on-policy 采样,靠 grafting 三步就能加新能力还不忘旧本事,比 SFT 和 OPSD 都强。
做模型持续训练的必看:不用贵的 on-policy 采样,靠 grafting 三步就能加新能力还不忘旧本事,比 SFT 和 OPSD 都强。
这篇论文用Qwen3-8B做了AppWorld上的合并vs联合训练对比,发现合并效果不输联合训练,而且解释了为什么不同合并方法结果差不多。