12:31官方账号arXiv cs.LG@Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein, Furong Huang论文提出β-OPSD,将普通在线自蒸馏(OPSD)推广为β=1特例的策略优化家族。β作为正则化参数,控制学生模型相对参考策略与特权教师之间的权衡。最优策略被推导为参考策略与教师的几何插值,实现时混合二者的token级logits。在数学推理基准上,β-OPSD比vanilla OPSD更稳定、推理性能更好。论文β-OPSD自蒸馏策略优化推荐理由:这篇论文把OPSD的隐式β变成可控参数,用蒸馏近似强化学习,数学推理上比原版更稳更强。原文稍后读已读值得跟进有用关注 β-OPSD