09:12官方账号arXiv cs.LG@Xixiang He, Xingming Li, Baiqi Wu, Qiyao Sun, Xuanyu Ji, Ao Cheng, Qingyong Hu精选73°研究人员提出MT-SDPO方法,通过自我锚点、答案验证资格和特权蒸馏三个组件整合多个冻结教师模型。该方法在Qwen3-8B模型上测试,将最弱领域性能提升14.79点,领域差距缩小74.7%。代码已在GitHub开源,地址为https://github.com/hexixiang/MT-SDPO。论文MT-SDPOQwen3-8B多教师蒸馏推荐理由:MT-SDPO方法让每个样本选择最可靠的教师,而非按领域匹配,大幅提升多领域大模型性能。原文稍后读已读值得跟进有用关注 MT-SDPO