Meta 提出替代 OPSD 的训练方法,Qwen3-8B 平均准确率从 30.76% 升至 65.97%
Meta 这次没走 self-distillation 老路,用 DCE 加 SRCL 就把 Qwen3-8B 从 30% 拉到 66%,方法细节可以看看。
Meta 这次没走 self-distillation 老路,用 DCE 加 SRCL 就把 Qwen3-8B 从 30% 拉到 66%,方法细节可以看看。
这篇论文把OPSD训练时模型思维崩溃的原因和解决方法都讲清楚了,AD-OPSD在数学题上能提4个点,做推理优化的值得看看。