09:29官方账号arXiv cs.AI@Sarthak Harne, Chinmay Karkar, Yash Pandya, Ahmed Awadallah, Akshay Nambi论文复现了SDPO在简单设置下的收益,但相同流程应用到困难任务(问答、数学、代码、多轮agentic工具使用)后失效。训练中每个token的损失持续下降,验证准确率却无法提升甚至退化。作者提出PI偏置分数,量化教师因见过单一参考解而对特定轨迹的偏向。学生匹配这种目标后,损失主要落在停用词、标点等低信息token上,并惩罚探索性token。结论是自蒸馏单独作为目标时,优化信号与任务成功并不挂钩。论文SDPOOPSD自蒸馏推荐理由:这篇论文把SDPO从简单题搬到难题上,发现loss降了但准确率不涨,还提出PI偏置分数解释原因,值得做蒸馏的人看。原文稍后读已读值得跟进有用关注 SDPO